タグ: SRE
「SRE」に関連する記事を表示しています。
AI障害復旧ツール導入の落とし穴、監視設計を後回しにすると起きる3つの問題
AI駆動の障害復旧ツールを監視基盤に組み込む前に確認すべき、アラート二重化・権限設計・根本原因分析の落とし穴を解説します。
MCPサーバーに認証がない問題、Prometheus連携で何が起きるか
MCPには認証・認可・監査ログの仕組みがなく、Prometheus等の監視基盤連携で情報漏洩や追跡不能な障害を招きかねません。確認方法と対策手順を整理しました。
RedisをMySQLに置き換えたShopify事例に学ぶ在庫予約設計の落とし穴
ShopifyがRedisをMySQLに置き換えて在庫予約をスケールさせた事例から、状態管理をどこに置くべきかの判断基準と移行手順を整理しました。
git pull本番運用の落とし穴、デプロイ鍵削除で13分の復旧が数時間に
cronでgit pull本番デプロイしていませんか。デプロイ鍵の削除が招いた503障害の原因分解と、IaC・CI/CD移行での対策を整理しました。
AWS運用のフィードバックループをSREのポストモーテムに変換する方法
AWSコミュニティのフィードバック文化を手がかりに、SREのポストモーテムやSLOレビューを機能させる仕組みを整理しました。
アンビエントAIスキャイブ導入で起きる同意記録の落とし穴と監視設計
アンビエントAIスキャイブが同意記録まで自動捏造した事例から、クラウドAPI連携の監視盲点と対策手順を整理しました。
Java 26のPanama移行、業務システムで急ぐと起きる3つの落とし穴
Java 26のPanama・仮想スレッドとKubernetes 1.35を既存の業務システムに導入する際に起きやすい3つの落とし穴と、確認・対策の手順を整理しました。
分散型SNS基盤ATProtocolは自社インフラで採用すべきか判断する4条件
Bluesky新CEOの発言を手がかりに、分散型プロトコル採用の可否をSRE視点の4軸(運用主体・コスト・監視・SLO設計)で判断する方法を整理しました。
マルチエージェントAI基盤設計、単一エージェントとの分離判断5つの軸
コーディングとテストを同一エージェントに任せると確認バイアスが起きます。マルチエージェント化すべきか、判断軸と選択肢を整理しました。
AI生成Terraform・Dockerfileが招く落とし穴、深夜障害で気づく前に
AIが生成したTerraformやDockerfileをそのまま使う運用に潜むリスクと、障害対応・コスト管理まで含めた確認手順を整理しました。
Argo CDのGitOpsハブが20,000オブジェクトでOOM落ちする理由と対策
Argo CDのGitOpsハブがクラスタ数ではなくオブジェクト数でOOM落ちする仕組みと、確認コマンド・対策手順を整理しました。
障害ポストモーテムを公開する前に確認すべき3つの落とし穴
障害対応の記録を技術ブログとして公開する動きに合わせ、クラウド運用ドキュメントに潜む情報漏洩リスクと確認手順を整理しました。