#Evaluation
10 件
- 🔁 エージェント運用の変更管理ループ: OpenAI Presence が示した器と、その中身の空白 2026-07-24
- 🎯 多段エージェントで対象固定が誤操作を3倍に増幅する現象と対処 - Binding Drift 2026-07-23
- 🧬 技術調査 - ハーネスを実行時に進化させる Test-Time Harness Evolution 2026-07-11
- ✅ 受け入れテスト駆動でLLMを評価する — 業務要件をリリースゲート化するATDLLMD拡張 2026-06-04
- 🔍 AI 評価レポートを「主張」と「証拠」に分けて書く - OpenAI 第三者評価 playbook を実装に落とす 2026-05-30
- 🔁 本番トレース×評価ループ×Codexで自己改善するAIエージェント設計 2026-05-28
- 🧪 技術調査 - agent-breakage: 自律K8s運用エージェントを反証可能に測る基盤 2026-05-26
- 📑 技術調査 - OpenAI×Databricks 企業文書エージェント評価ハーネス設計 2026-05-17
- 🧪 非決定的な AI エージェントの検証 - PTA + Dominator で Trust Layer を構築する 2026-05-08
- 🧪 業務エージェント評価を 4 シグナル採点で組み直す: Claw-Eval-Live を実務に落とす 2026-05-05