#SRE
16 件
- 🚦 Metaのヘルスチェック基盤SHCに学ぶ、段階展開と自動ロールバックの接続点 2026-08-25
- 🚧 GitHub 8月17日障害を読み解く: 出荷を止めたのは認証ゲートだった 2026-08-21
- 🚦 AIエージェントに実行権限をどこまで渡すか 段階的権限解放の設計 2026-08-18
- 🛟 Kubernetes更新の無人化を支える構造: A/Bフェイルセーフとetcd Quorum保護 2026-08-16
- 🚨 AIの暴走課金はなぜ5か月気づかれないのか - Amazonの予算860%超過に学ぶ統制設計 2026-07-31
- 🧩 障害履歴を症状・原因・対処の三つ組で検索する OM-RAG の設計 2026-07-28
- 🧯 サイバー障害の復旧を3層に分解する: 設計RTO1時間の会社が11日かかった理由 2026-07-27
- 🧭 自律SRE前提のコンテキスト基盤設計 (SREの4体問題) 2026-07-09
- 🔍 AIに障害対応させる前に設計すべき、証拠捏造を見抜く検証プロトコル 2026-07-05
- 🛡️ 共有インフラ事故の初動を診断するCLI siir の構造と設計判断 2026-07-01
- 🛡️ AIモデルが突然使えなくなる日に備える モデル可用性BCPの設計 2026-06-14
- 🛡️ 本番AIエンドポイントを推論盗用から守る多層防御とコスト境界の設計 2026-06-02
- 🤖 SREの判断プロセスのどこを機械化するか — Google SRE の agentic AI 運用と承認設計 2026-05-30
- 🧪 技術調査 - agent-breakage: 自律K8s運用エージェントを反証可能に測る基盤 2026-05-26
- 🧪 業務エージェント評価を 4 シグナル採点で組み直す: Claw-Eval-Live を実務に落とす 2026-05-05
- 🚀 技術調査 - Grafana k6 2025-07-15