タグ: SRE
「SRE」に関連する記事を表示しています。
Kelly基準の資金配分ロジックをクラウド運用の視点で監視する方法
Polymarket向け資金配分ボットを題材に、クラウド運用・監視設計・障害対応の観点から本番稼働前に確認すべき判断軸を整理しました。
GoFundMeのCEO交代に学ぶ、障害対応の意思決定基準
GoFundMeのCEO交代の経緯から、社会インフラ化したサービスの障害対応・SLO設定・組織体制の判断基準を整理しました。
AWS移行後もSSHがパスワード認証のまま?初動30分の放置が招く侵害
クラウド移行直後にSSHのパスワード認証を放置すると初期侵入のリスクが高まります。確認コマンドと監視への組み込み方まで手順で整理しました。
MCPサーバーは何個まで運用可能か 75000件の選び方と監視設計
MCPサーバーが75000件規模に増える中、個別接続か集約プロキシかをどう選ぶか。判断軸と障害切り分けの観点から整理しました。
AWS/Azure/GCPのオートスケーリング設定、Terraform適用で消えていませんか
ASG・ECS・VMSS・MIGで、Terraform適用がコンソール変更を無言で上書きする現象の原因と、棚卸し・インポート・監視の手順を整理しました。
AIエージェントの障害調査を早くするOpenTelemetry設計
AIエージェントのLLM呼び出しやツール実行をOpenTelemetryで可視化する設計を、SREの障害対応・コスト最適化の視点から整理しました。
UAT-10147の攻撃手口とは 17万URL標的の侵入経路を点検する
AIで攻撃コードを自動修正するUAT-10147の手口を解説。既知脆弱性・権限昇格・ロットキットの侵入経路を自組織で点検する具体的な確認コマンドと対策手順を紹介します。
OpenAIのGB200 NVL72採用に学ぶラック単位設計の判断軸
OpenAIのGB200 NVL72採用をもとに、ラックスケール基盤とRubin構想の違い、学習・推論統合設計のトレードオフを整理しました。
個人開発のAI株取引アプリを本番運用する前に見直す可用性設計5点
AI機能付き個人開発アプリをAWSで本番運用する前に、SLO設計・IaC・オブザーバビリティ・コスト監視の観点で見直すべき5つの確認ポイントを整理しました。
Codexの操作権限拡大で起きる本番障害、監視設計で防ぐ方法
AIエージェントがIDEを出てOSを操作する時代に、権限設計・監査ログ・承認ゲートの見直しが必要な理由と確認手順をまとめました。
MCPサーバーはステートフル化すべきか セッション設計の判断基準
MCPサーバーをクラウドで複数台運用する際、セッション方式とステートレス方式のどちらを選ぶべきか、スケーラビリティや障害対応の観点から判断基準を整理しました。
ThingsBoardとBlynk、IoT基盤はどれを選ぶべきか 6製品比較
ThingsBoard・Blynk・Virtuino CloudなどIoT基盤6製品を、コマンド確認・LWT・自己ホスト可否というSRE視点の判断軸で比較しました。