#LLMOps
30 件
- 🧭 LLMOpsは誰が持つのか、AIパイプラインの所有境界を設計する 2026-08-15
- 🧭 小型モデル移行を支える製品ハーネスの評価設計 2026-07-26
- 🧪 正解データ不要でRAG検索の網羅性を測るテスト十分性基準 - Chunk Coverage 2026-07-25
- 🔁 エージェント運用の変更管理ループ: OpenAI Presence が示した器と、その中身の空白 2026-07-24
- 🧪 自己修正バイアスを防ぐ契約駆動のSkill評価CI - AEVAL 2026-07-22
- ⏳ エージェント記憶の鮮度設計 静かに嘘になる記憶をどう扱うか 2026-07-20
- ⚖️ 隔離 worktree と機械計測で導入可否を決める - Claude Code Skills の A/B 評価ハーネス 2026-07-20
- 🔄 基盤モデルを更新し続ける移行運用モデル - 互換性評価・段階切替・ロールバックの標準移行路 2026-07-17
- ⚖️ マルチエージェント並列化の損益分岐点 — いつ分割し、いつ単一エージェントへ戻すか 2026-07-17
- 🧮 技術調査 - GPT-5.6三階層のタスク別計算予算と実行基盤 2026-07-11
- ⚖️ 「AIはもう十分賢い」の先へ 評価・ガバナンスへの投資シフトを検証する 2026-07-07
- 🛡️ 技術調査 - Claude Opus 4.7 の高リスクサイバー遮断と Cyber Verification Program 2026-06-23
- 📑 技術調査 - AIコーディングの委任契約とレビュー可能性 2026-06-18
- 🛡️ AIモデルが突然使えなくなる日に備える モデル可用性BCPの設計 2026-06-14
- 🚦 能力制限付きルーティング — Fable 5 に学ぶLLMゲートウェイ設計 2026-06-13
- ✅ 受け入れテスト駆動でLLMを評価する — 業務要件をリリースゲート化するATDLLMD拡張 2026-06-04
- 🔀 技術調査 - Claude Code 動的ワークフロー:並列実行の責任境界と検証設計 2026-05-30
- 🤖 SREの判断プロセスのどこを機械化するか — Google SRE の agentic AI 運用と承認設計 2026-05-30
- 🕸️ 技術調査 - エージェントワークフローの構造カバレッジテスト 2026-05-28
- 🔁 本番トレース×評価ループ×Codexで自己改善するAIエージェント設計 2026-05-28
- 🔭 Jaeger×OpenTelemetryでAIエージェントの意思決定→ツール実行をトレースする 2026-05-27
- ☁️ 技術調査 - クラウドコーディングエージェントは実行環境が品質を決める 2026-05-26
- 📡 技術調査 - OpenTelemetry CNCF Graduated 2026-05-22
- 🧱 技術調査 - dbt の Semantic Layer × MCP × Agent Skills 3層スタック 2026-05-20
- 🧭 技術調査 - Google Cloud の Agentic Data Layer 5 シナリオ 2026-05-19
- 📊 技術調査 - OfficeQA Pro / 企業文書エージェント評価ハーネス 2026-05-18
- 📑 技術調査 - OpenAI×Databricks 企業文書エージェント評価ハーネス設計 2026-05-17
- 💡 技術調査 - Bedrock Advanced Prompt Optimization & Migration 2026-05-16
- 🧪 業務エージェント評価を 4 シグナル採点で組み直す: Claw-Eval-Live を実務に落とす 2026-05-05
- 🚦 ホスト型 LLM のサイレント更新を CI/CD でゲートする - Test-Before-You-Deploy フレームワーク実践ガイド 2026-05-02