#LLM
145 件
- 🔍 要件レビューでLLMを先に読ませると検出精度は上がらない 2026-08-25
- 🔀 仕様ファイルはエージェント中立ではない、SQL移行実験から読む移管ゲートの置き方 2026-08-25
- 💰 GPT-5.6 Solの期間限定値下げをコスト計画に入れる前に整理すること 2026-08-24
- 🗺️ 2026年夏のオープンモデル地図:Qwen一強ではない用途別の選び方 2026-08-24
- 🧩 Googleのマルチエージェント委譲4原則を契約・コスト・最小権限・認知摩擦で検証する 2026-08-23
- 🧾 エージェントの出力・ツール呼び出し・監査文脈を束ねる評価契約 - ECP 2026-08-22
- 🧠 LLMを正しく捉える6つの基礎概念 ― 次トークン予測からContext Rotまで 2026-08-22
- 🧮 コーディングエージェントの成否は着手前に予測できるか(arXiv:2608.18280) 2026-08-21
- 🔍 AIを入れても業務量が減らない構造 - LINEヤフーの商品パトロール事例 2026-08-21
- 🔗 局所240倍が全体3割に収束する理由|工程分割型AIエージェントの主戦場 2026-08-20
- 🛡️ 実行証跡で Agent Skill を検証し安全に自動生成する - TRUSS 2026-08-20
- 🧭 5つのAIエンジニアリングを2軸3階層で整理する - Prompt / Context / Loop / Harness / Graph 2026-08-20
- 🚦 AIエージェントに手順を「お願い」しても効かない、スキップ不能にすると効く 2026-08-19
- 🧯 GUIエージェントの評価に原子性を持ち込む:完遂か、副作用のない失敗か 2026-08-18
- 🧩 LLMコード移行の単位は「機能」ではない — 依存グラフの閉包で分ける 2026-08-18
- 🧬 古い決定が再浮上する問題に、オントロジー型のプロジェクト記憶で挑むMOOSEDev 2026-08-18
- 🚦 AIエージェントに実行権限をどこまで渡すか 段階的権限解放の設計 2026-08-18
- 🧭 Text-to-SQLにセマンティックレイヤーを挟むと何が起きるか 2026-08-18
- 🧮 常駐AIエージェントのコストは、モデル単価ではなくセッション設計で決まる 2026-08-17
- 🧱 エージェントAIが失敗する場所はモデルではなくデータ基盤にある 2026-08-16
- 📋 制度改定を手順書と記録項目まで伝播させる — 通達DiffのAI実装と限界 2026-08-16
- ⚖️ LLMアプリの受け入れ判定を要件から組み立てるREAGとカスケード判定 2026-08-15
- 🔧 同じ能力でも一貫性が4.7倍変わる - コーディングエージェントのツール設計 2026-08-14
- 🔧 LLMを分類器にしない: 知識グラフ誘導RAGで車載HiLの原因分析を説明可能にする 2026-08-14
- 🧭 コードを外に出さずドメインモデルを抽出する段階的パイプライン 2026-08-14
- 🧩 AIエージェントの構成管理をグラフで解く — ACM参照モデルの読み方 2026-08-13
- 🧪 セキュリティテストを先に見せるとAI生成コードはどう変わるか 2026-08-13
- 🧭 企業のAI活用格差は、権限と共有ワークフローの設計差である 2026-08-13
- 🛑 エージェントの「停止」は効いていない - 承認ゲートが副作用を漏らす構造と外部ゲート設計 2026-08-12
- 🧭 同じ最終仕様でも実装が変わる: コーディングエージェントの仕様経路感度 2026-08-12
- 🌪 LLM API障害をHTTP層で注入するカオスエンジニアリング - AgentChaos 2026-08-11
- 🛰️ エージェントの監視をLLMに任せない: LivePlanに学ぶ逸脱検知と介入設計 2026-08-11
- 🏢 NECの全役割AI組織を読む:人間を評価・意思決定・統制に限定する設計 2026-08-11
- 📊 AIネイティブ財務の設計図: 予測自動化と内部統制を同時に成立させる条件 2026-08-11
- 🧭 AIレビューの「指摘0件」は独立検証ではない - 4つの直交軸で読み替える 2026-08-10
- 🧯 評価用エージェントがサンドボックスを脱出した事例から、AI運用の封じ込め設計を考える 2026-08-10
- 🔤 AIが最も間違えるのは「バイト」— 固定長・SJIS処理の5つの罠とガードレール 2026-08-09
- 🧭 ASPICE 4.0 SYS.2の整合性チェック、AIに任せる範囲と人の責任を分ける 2026-08-09
- 🛡️ 悪性Skill 2,826件でCLIエージェントの96%が攻撃実行された話 2026-08-08
- 🛂 LLMトレースのPII除去とコスト正規化はOpenTelemetry Collectorへ寄せる 2026-08-08
- ⚓ ビルドは通るのに「検証済み」だけが失効する問題を成果物依存グラフで捉える 2026-08-07
- 🧭 エージェントの実行履歴を決定的ワークフローへ変換する - TraceCompiler論文の要点 2026-08-06
- 🔁 LoopsBench に学ぶ、長期開発でエージェントが壊れる場所と設計の勘所 2026-08-05
- 🧩 AIエージェントの手順を再利用可能にするオープン形式 - Agent Skills 2026-08-04
- 🧹 AIコード編集の29%は消さずにガードで残す「Guard-and-Go」と変更契約 2026-08-04
- 🔦 AI生成差分のレビューを絞り込む:ARCTICの意図・逸脱・重点箇所という3軸 2026-08-04
- 🧪 修復エージェントの合格テスト、46%はバグを検証していない 2026-08-04
- 🔊 音声経路と推論・ツール実行を非同期分離したリアルタイム基盤 - OpenAI GPT-Live 2026-08-04
- 🛡️ タスク完了率93.7%の裏側 - エージェント実行の66.2%が危険なまま完了していた 2026-08-01
- 🧭 GPT-5.6 Lunaの80%値下げで問い直すべきは単価ではなく工程設計 2026-08-01
- 🧪 AI生成テストの「写経オラクル」問題と、意味的オラクルを自動生成するPROGRESS 2026-08-01
- 🚨 AIの暴走課金はなぜ5か月気づかれないのか - Amazonの予算860%超過に学ぶ統制設計 2026-07-31
- 🚦 エージェントの誤行動を止めるのは賢さではなく配置 — 実行時データ品質ゲートSARC-DQ 2026-07-31
- 🧬 正解データなしでRAGを回帰テストする「メタモルフィックテスト」の考え方 2026-07-31
- 🛡 Skill導入前の悪性判定でLLM入力トークンを77%削減するSkillGateの構造 2026-07-30
- 🧩 AI生成コードの「暗黙の前提」を成果物にする — AssumptionMinerの読み解き 2026-07-29
- 🧪 実トラフィックから回帰テストを生成する: NL2Testの役割分担設計 2026-07-29
- 🗃️ 画面を見ないPC操作エージェント: StateActが示す状態基盤設計 2026-07-29
- 🔍 AIレビュー5万4791件の分析: 指摘が直される条件と直されない理由 2026-07-28
- 🧪 Skillのテストは何を漏らすか - Skill Test Coverageで未検証の運用義務を測る 2026-07-28
- 🧩 障害履歴を症状・原因・対処の三つ組で検索する OM-RAG の設計 2026-07-28
- 🔌 セッションと初期化ハンドシェイクを廃止したステートレス改訂 - MCP 2026-07-28 2026-07-27
- 🚧 無人公開のfail-closedゲートは、どの層に置くと効くのか 2026-07-27
- 🧪 正解データ不要でRAG検索の網羅性を測るテスト十分性基準 - Chunk Coverage 2026-07-25
- 🎯 多段エージェントで対象固定が誤操作を3倍に増幅する現象と対処 - Binding Drift 2026-07-23
- 🧪 安全機構を外したAI評価の封じ込め設計と責任の空白 2026-07-23
- 🧪 自己修正バイアスを防ぐ契約駆動のSkill評価CI - AEVAL 2026-07-22
- 🚦 リポジトリ内で反例を仕様へ昇格させるエージェント合成 - Counterexample-Supplemented Sketches 2026-07-21
- 🔍 PRの振る舞い差を露出させる変更誘導型テスト生成 - DiffTestGen 2026-07-21
- 🛡️ 長時間稼働エージェントの権限設計: 軌跡監視を支える4層構造 2026-07-21
- 🧩 シナリオ誘導で設計意図を絞る検証付き LLM 合成 - Concept Design と foundry 2026-07-21
- 🔐 エージェントの権限設計を OS 能力とユーザー同意の 2 軸で分解する 2026-07-20
- ⏳ エージェント記憶の鮮度設計 静かに嘘になる記憶をどう扱うか 2026-07-20
- 🧪 実装より先に評価系を設計する - AI生成コードの評価オラクル 2026-07-20
- 🪙 AI Tokenomics:コーディングのトークン効率を工程で設計する11原則 2026-07-19
- 🛡️ 自律AIエージェント攻撃に学ぶ、権限境界とインシデント対応の設計 2026-07-17
- 🛡️ GPT-Red解説:自己対戦レッドチームと、AIリリース判定の再設計 2026-07-16
- 🔁 AfterVibe - 会話履歴とコードから再生成可能な仕様を復元する手法 2026-07-15
- 🧪 技術調査 - AgentCheck:MCPツール障害を注入してエージェント耐性を測るワークベンチ 2026-07-15
- 🔧 技術調査 - 自動ハーネス適応で小型モデルを96%安く動かす 2026-07-14
- 🧩 テストもSASTも素通りするAI生成コードの構造破綻「Patchwork Problem」 2026-07-14
- 🧠 技術調査 - Memory in the Loop:エージェントのメモリをループ内に置く設計 2026-07-12
- 🧭 エージェント導入を「作る前」に潰す20の問い — Google Cloudの設計レビュー枠組み 2026-07-11
- 🔍 Copilot code review はなぜ共有ツールで悪化したか - ツール指示を仕事に合わせる 2026-07-11
- 🧬 技術調査 - ハーネスを実行時に進化させる Test-Time Harness Evolution 2026-07-11
- 🛡️ 社内RAG乱立を収束させる全社基盤の設計 承認・認可・品質ゲートを組み込む 2026-07-10
- 💎 技術調査 - Progressive Crystallization(エージェント探索の決定論化) 2026-07-10
- 🚪 技術調査 - 全社AIゲートウェイ(Internal Key方式の入口プロキシ) 2026-07-09
- ⚖️ 「AIはもう十分賢い」の先へ 評価・ガバナンスへの投資シフトを検証する 2026-07-07
- 🔍 AIを実装要員でなく「リリース前監査役」に置く出荷判断の型 2026-07-06
- 🔍 AIに障害対応させる前に設計すべき、証拠捏造を見抜く検証プロトコル 2026-07-05
- 🛡️ AIネイティブ開発組織のリスクアーキテクチャ再設計 — 確率的エージェントの失敗を誰が止めるか 2026-07-04
- 🚧 技術調査 - UnderSpecBench: 曖昧なDevOps指示でAIエージェントの行動時55〜68%が境界逸脱 2026-07-04
- 🚦 最上位モデルが止まる前提の可用性設計:発注側が織り込む4項目 2026-07-03
- 🔧 Claude Sonnet 5 移行で壊れるAPI前提と運用破断点の棚卸し 2026-07-02
- 🛡️ Google Cloud の自律SDLCセキュリティ — AIで脆弱性を発見・検証・修正する閉ループ設計 2026-06-30
- 🗂️ 技術調査 - RAGの回答精度を左右する非構造データ継続パイプライン設計 2026-06-29
- 🗂️ Claude Code の指示をどこに書くか — 7つの指示面とコンテキスト負債の設計 2026-06-25
- 🧾 味の素の経理AIエージェントに学ぶ 承認業務をAIに委任する前提条件 2026-06-21
- 📊 技術調査 - GitHub 社内データ分析エージェント Qubot 2026-06-20
- 🕵️ 技術調査 - MosaicLeaks 2026-06-20
- 🛡️ 技術調査 - Cloudflare 脆弱性探索ハーネス (VDH/VVS) 2026-06-19
- 🧹 技術調査 - AGENTS.md・CLAUDE.md 設定ファイルの設計臭6分類 2026-06-17
- 🛡️ AIモデルが突然使えなくなる日に備える モデル可用性BCPの設計 2026-06-14
- 🤖 技術調査 - Trinity(自己ホスト型 AI エージェント運用基盤) 2026-06-14
- 🚦 能力制限付きルーティング — Fable 5 に学ぶLLMゲートウェイ設計 2026-06-13
- 🔑 技術調査 - GitHub Secret Scanning の後段 LLM 文脈検証 2026-06-12
- ✂️ 技術調査 - 長時間エージェントのコンテキスト設計(Less Context, Better Agents) 2026-06-11
- 🧪 技術調査 - TestMap:AI生成テストを証拠付きで評価する基盤設計 2026-06-11
- 🛡️ 技術調査 - 悪性 Agent Skill を実行時検証する MalSkillBench 2026-06-09
- 🎛️ 本番AIエージェントは「自律性」より「制御可能性」で動く—実証研究MAPを読む 2026-06-09
- 🔍 Alibaba Open Code Review:「LLMに行番号を出させない」AIレビュー設計 2026-06-08
- 💸 Cloudflare AI Gateway「Spend Limits」を解剖する — AIの権限委任をドル建て予算で設計する 2026-06-06
- 🧠 技術調査 - OpenAI Dreaming に学ぶAIエージェント記憶設計の6区分 2026-06-06
- ✅ 受け入れテスト駆動でLLMを評価する — 業務要件をリリースゲート化するATDLLMD拡張 2026-06-04
- 🗂️ 技術調査 - Agents Schema 2026-06-04
- 🧠 AIエージェントの長期記憶アーキテクチャ 記憶のライフサイクル管理という設計論 2026-06-04
- 🛡️ Thoughtworks - AI Assurance:Enterprise AIの品質保証を継続的リスク低減へ 2026-06-04
- 🛡️ 本番AIエンドポイントを推論盗用から守る多層防御とコスト境界の設計 2026-06-02
- 🧨 コーディングエージェントは何を壊すのか──運用安全性失敗547件の実証研究 2026-06-02
- 🔍 AI 評価レポートを「主張」と「証拠」に分けて書く - OpenAI 第三者評価 playbook を実装に落とす 2026-05-30
- 🛡️ 技術調査 - Cloudflare Town Lake / Skipper(監査可能なNL-SQLエージェント) 2026-05-29
- 🔁 状態を持つアプリをLLMエージェントに操作させるトランザクション設計と適用限界 2026-05-27
- 🧪 技術調査 - agent-breakage: 自律K8s運用エージェントを反証可能に測る基盤 2026-05-26
- 🔌 技術調査 - Codex App Server 2026-05-21
- 🛡️ 技術調査 - Unsafe by Flow / MCP-BiFlow 2026-05-12
- 📑 技術調査 - LLMエージェント時代の上場企業データインフラ設計 2026-05-11
- 🧰 技術調査 - DADL (Dunkel API Description Language) 2026-05-09
- 🧪 非決定的な AI エージェントの検証 - PTA + Dominator で Trust Layer を構築する 2026-05-08
- 🤖 技術調査 - Hermes Agent 2026-05-04
- 🚦 ホスト型 LLM のサイレント更新を CI/CD でゲートする - Test-Before-You-Deploy フレームワーク実践ガイド 2026-05-02
- 🦾 技術調査 - harness 2026-04-21
- 📝 技術調査 - markitdown 2026-04-13
- 🔍 技術調査 - Jina Reader 2026-04-04
- ⚡ 技術調査 - Agent Lightning 2026-02-19
- 🤝 AIコーチングの現在 2025-10-25
- 🤖 技術調査 - PR-Agent 2025-08-18
- 🤖 技術調査 - Serena MCP 2025-08-08
- 🧠 コンテキストエンジニアリング入門:AIに何を渡すかをシステムとして設計する 2025-07-20
- 🚀 RAGの精度が出ない...は卒業。グラフDBで 文脈の時系列 を捉える高機能RAGバックエンド「local-RAG-backend」 2025-06-22
- 🛠️ 技術調査 - Unstructured 2025-06-19
- 🕸️ 技術調査 - Graphiti 2025-06-05
- 🚀 プロンプトエンジニアリングの進化 - 人間中心からAIエージェントへ 2025-05-29
- 🧩 既存環境からterraformにリバースエンジニアリングする流れとツールの使い所 2025-05-22
- ⚙️ 技術調査 - RAGの精度向上戦略 2025-05-16