#LLM
211 件
- 🔍 AgentTracerが間接プロンプト注入の攻撃列を意図のずれから追跡する 2026-10-09
- 🔍 理解監査は、AI研究の担当者が中身を説明できるかを開発継続の条件にする提案 2026-10-09
- 🪶 Claude Haiku 5.5の仕様、価格、サブエージェントへの置き方 2026-10-08
- 🔐 AnthropicのCyber Verification Programは作業の通し方で3枠に分かれた 2026-10-08
- 🔧 GoogleのFlowAgentは提出前のテスト失敗を次の編集までの分で直す 2026-10-08
- ⚖️ 確率と選択を返すOpenAI Decisions APIの使い方 2026-10-08
- 🏦 みずほとライオンがQwenを自社環境で動かすとき発注側が見る4行 2026-10-07
- 🤖 源内で職員が作ったものを数えるとき発注側が見る5段 2026-10-07
- 🧩 複合AIの本番障害150件から見る境界ごとの失敗分類 2026-10-06
- 🧪 GitHubのReviewBenchでAIコードレビューの適合率と再現率を分ける 2026-10-06
- 🧪 GTDDは実装を固定したあと追加テストでコーディングエージェントを検査する 2026-10-06
- 📦 ThinkingBoxは業務完了を終端のデータベース状態で判定する 2026-10-06
- 🧪 WebUIProofは生成画面を見た目だけでなく操作後の挙動で採点する 2026-10-06
- 💸 従量課金APIに既定のハード予算上限を置く 2026-10-05
- 📄 繰り返す帳票OCRは範囲を登録して列を固定する 2026-10-04
- 🧭 CONTRAは仕様の空白を埋める問いと黙って決めた挙動を分ける 2026-10-03
- 🔒 Guarded Commitsは不可逆な外部操作の承認をコミット条件にする 2026-10-03
- 🧭 GPT-6ファミリーの実務ガイドに書かれたモデル・推論努力・指示の分け方 2026-10-03
- 💎 Gemini 4 Argonは長い出力の候補で既定は3.8 Flashのまま 2026-10-01
- 🧭 OpenAI dotsを不在中に任せるときの目標と停止と対外操作と課金 2026-10-01
- 🧰 Strands harnessの構成とモデルを替えても残る境界 2026-09-29
- 💬 ドコモ手続き窓口の対話AIは不足を聞き返し、登録は利用者が行う 2026-09-29
- 📘 エージェントスキルは100万件規模、手順はチーム固有のまま 2026-09-26
- 🧰 Claude Code Migration Kitで言語を全面移行するときの手順と制約 2026-09-26
- 🏗️ 建設工程の作業・歩掛・数量を結ぶ4つの設計 2026-09-26
- ☁️ Claude Codeのクラウドセッション一般提供で押さえる実行先、承認、停止、課金 2026-09-25
- 🧪 mizchi/jev-playground の実験から Jev の答えの形と計測の落とし穴を学ぶ 2026-09-24
- 🧭 Claude Opus 5.5をAI Gatewayで読むときの能力と価格 2026-09-23
- 📦 GPT-6のプロンプトキャッシュに明示ブレークポイントと診断が加わる 2026-09-23
- 📐 GPT-6 SolとLunaは仕事の規模で能力と単価を分ける 2026-09-23
- 🎲 拡散LLMのDiffusionGemmaでJev互換の型付き判断APIを自己ホストするdjevの構造と使い方 2026-09-22
- 🧭 OpenAIのAI国際技術標準提言を、能力測定と重大度別インシデント報告から読み解く 2026-09-22
- 🧪 資生堂の原料探索エージェントは探索・候補化・評価をどう分けるか 2026-09-21
- 🧭 型付きの決定を返すモデル Jev の活用法を公式4パターンと実測例から整理する 2026-09-21
- 🧭 OpenCodeとLiteLLMで全社AIの入口とモデル契約を分ける 2026-09-20
- 🧭 Anthropicが開発組織へ入れる埋め込み評価とは何か 2026-09-20
- 🧭 Claude CodeがCLAUDE.md不在時にAGENTS.mdを読む互換導線を追加した 2026-09-19
- 🧪 コーディングエージェントの性能差を計画、文脈管理、操作空間へ分解した実証研究 2026-09-19
- 🧮 DeltaSelectでコーディングエージェントのスキル変更をドル予算内で反復比較する 2026-09-19
- 🍎 Apple SiliconのMacでJev風の判断APIを動かすdiffusiongemma-jev-macosの構造と使い方 2026-09-19
- 🎯 コードが消費できる型付き決定を返すホスト型モデル Jev の構造と使い方 2026-09-19
- 🧩 Afforaは人とエージェントが同じ画面を読むためのデザイン規則 2026-09-18
- 🧷 圧縮要約へ混入する自己生成プロンプトインジェクション 2026-09-18
- 🧭 LLM利用の許可は機密除去と生成コード確認の担当を消さない 2026-09-17
- 🧭 IBM ResearchのConsistency Analyzerでエージェントの反復実行の揺れを診断する 2026-09-17
- 🧪 Ericssonの4観点Skillsと知識グラフによるコードレビュー現場評価 2026-09-16
- 🔨 失敗実行を起点にプロンプトと訓練データを同時更新するForge 2026-09-16
- 🔎 エージェント記憶を読み取り専用プローブで再検証してから書く 2026-09-12
- 📐 KDDI BuffmeeのRAG評価設計と実行経路の見直し 2026-09-10
- 🧪 GitHub CopilotのHydraFusionは品質ゲート付きの実行時ワークフロー編成 2026-09-05
- 🚪 SWE-Gateは機能テスト通過644件のうち221件でレビュー制約に落ちる 2026-09-05
- 🧩 異種エージェント構成を共通の承認単位で版管理するACM 2026-09-04
- 🧩 HEARTが2万5519ツールを自然言語で選ぶ仕組みと現場が先に取る遅延ロード 2026-09-04
- 📦 NVIDIAのHugging Face買収合意で本番が晒されるのはmainの取得設計 2026-09-04
- 🧰 11種のコーディングエージェント分析で抽出された7構成要素と29設計パターン 2026-09-03
- 📉 GitHub Copilotが示した局所的な出力短縮が総タスクコストを増やす逆説 2026-09-03
- 🔧 GitOps修復でモデルにYAMLを書かせない決定論的フィールド編集 2026-09-03
- 🔒 閉域OSSのAI基盤を21シナリオで検証したICS-XAF 2026-09-03
- 🧭 Fable 5.1とMythos 5.1の差はモデル世代ではなく利用契約である 2026-09-02
- 🧭 チケット履歴からアーキテクチャ意図を復元してドリフトを可視化するLLMパイプライン 2026-09-01
- ⏱️ 無操作でも回るエージェントで、停止と通知とコストをモデルの外に置く 2026-08-31
- 🚦 LLMの本番投入判定を成果・安全・運用の3層で設計する 2026-08-28
- 🚦 AIエージェントのツール実行を型付きイベントで仲介するMetisの設計 2026-08-28
- 📚 OKFバンドルをKnowledge Catalogへ統合する構成と運用上の制約 2026-08-27
- 🔓 評価用エージェントがHugging Faceを侵害した経路と共有基盤という盲点 2026-08-27
- 🧭 リポジトリ固有のAgent Skillは警告なく陳腐化する 2026-08-26
- 🔍 要件レビューでLLMを先に読ませると検出精度は上がらない 2026-08-25
- 🔀 仕様ファイルはエージェント中立ではない、SQL移行実験から読む移管ゲートの置き方 2026-08-25
- 💰 GPT-5.6 Solの期間限定値下げをコスト計画に入れる前に整理すること 2026-08-24
- 🗺️ 2026年夏のオープンモデル地図:Qwen一強ではない用途別の選び方 2026-08-24
- 🧩 Googleのマルチエージェント委譲4原則を契約・コスト・最小権限・認知摩擦で検証する 2026-08-23
- 🧾 エージェントの出力・ツール呼び出し・監査文脈を束ねる評価契約 - ECP 2026-08-22
- 🧠 LLMを正しく捉える6つの基礎概念 ― 次トークン予測からContext Rotまで 2026-08-22
- 🧮 コーディングエージェントの成否は着手前に予測できるか(arXiv:2608.18280) 2026-08-21
- 🔍 AIを入れても業務量が減らない構造 - LINEヤフーの商品パトロール事例 2026-08-21
- 🔗 局所240倍が全体3割に収束する理由|工程分割型AIエージェントの主戦場 2026-08-20
- 🛡️ 実行証跡で Agent Skill を検証し安全に自動生成する - TRUSS 2026-08-20
- 🧭 5つのAIエンジニアリングを2軸3階層で整理する - Prompt / Context / Loop / Harness / Graph 2026-08-20
- 🚦 AIエージェントに手順を「お願い」しても効かない、スキップ不能にすると効く 2026-08-19
- 🧯 GUIエージェントの評価に原子性を持ち込む:完遂か、副作用のない失敗か 2026-08-18
- 🧩 LLMコード移行の単位は「機能」ではない — 依存グラフの閉包で分ける 2026-08-18
- 🧬 古い決定が再浮上する問題に、オントロジー型のプロジェクト記憶で挑むMOOSEDev 2026-08-18
- 🚦 AIエージェントに実行権限をどこまで渡すか 段階的権限解放の設計 2026-08-18
- 🧭 Text-to-SQLにセマンティックレイヤーを挟むと何が起きるか 2026-08-18
- 🧮 常駐AIエージェントのコストは、モデル単価ではなくセッション設計で決まる 2026-08-17
- 🧱 エージェントAIが失敗する場所はモデルではなくデータ基盤にある 2026-08-16
- 📋 制度改定を手順書と記録項目まで伝播させる — 通達DiffのAI実装と限界 2026-08-16
- ⚖️ LLMアプリの受け入れ判定を要件から組み立てるREAGとカスケード判定 2026-08-15
- 🔧 同じ能力でも一貫性が4.7倍変わる - コーディングエージェントのツール設計 2026-08-14
- 🔧 LLMを分類器にしない: 知識グラフ誘導RAGで車載HiLの原因分析を説明可能にする 2026-08-14
- 🧭 コードを外に出さずドメインモデルを抽出する段階的パイプライン 2026-08-14
- 🧩 AIエージェントの構成管理をグラフで解く — ACM参照モデルの読み方 2026-08-13
- 🧪 セキュリティテストを先に見せるとAI生成コードはどう変わるか 2026-08-13
- 🧭 企業のAI活用格差は、権限と共有ワークフローの設計差である 2026-08-13
- 🛑 エージェントの「停止」は効いていない - 承認ゲートが副作用を漏らす構造と外部ゲート設計 2026-08-12
- 🧭 同じ最終仕様でも実装が変わる: コーディングエージェントの仕様経路感度 2026-08-12
- 🌪 LLM API障害をHTTP層で注入するカオスエンジニアリング - AgentChaos 2026-08-11
- 🛰️ エージェントの監視をLLMに任せない: LivePlanに学ぶ逸脱検知と介入設計 2026-08-11
- 🏢 NECの全役割AI組織を読む:人間を評価・意思決定・統制に限定する設計 2026-08-11
- 📊 AIネイティブ財務の設計図: 予測自動化と内部統制を同時に成立させる条件 2026-08-11
- 🧭 AIレビューの「指摘0件」は独立検証ではない - 4つの直交軸で読み替える 2026-08-10
- 🧯 評価用エージェントがサンドボックスを脱出した事例から、AI運用の封じ込め設計を考える 2026-08-10
- 🔤 AIが最も間違えるのは「バイト」— 固定長・SJIS処理の5つの罠とガードレール 2026-08-09
- 🧭 ASPICE 4.0 SYS.2の整合性チェック、AIに任せる範囲と人の責任を分ける 2026-08-09
- 🛡️ 悪性Skill 2,826件でCLIエージェントの96%が攻撃実行された話 2026-08-08
- 🛂 LLMトレースのPII除去とコスト正規化はOpenTelemetry Collectorへ寄せる 2026-08-08
- ⚓ ビルドは通るのに「検証済み」だけが失効する問題を成果物依存グラフで捉える 2026-08-07
- 🧭 エージェントの実行履歴を決定的ワークフローへ変換する - TraceCompiler論文の要点 2026-08-06
- 🔁 LoopsBench に学ぶ、長期開発でエージェントが壊れる場所と設計の勘所 2026-08-05
- 🧩 AIエージェントの手順を再利用可能にするオープン形式 - Agent Skills 2026-08-04
- 🧹 AIコード編集の29%は消さずにガードで残す「Guard-and-Go」と変更契約 2026-08-04
- 🔦 AI生成差分のレビューを絞り込む:ARCTICの意図・逸脱・重点箇所という3軸 2026-08-04
- 🧪 修復エージェントの合格テスト、46%はバグを検証していない 2026-08-04
- 🔊 音声経路と推論・ツール実行を非同期分離したリアルタイム基盤 - OpenAI GPT-Live 2026-08-04
- 🛡️ タスク完了率93.7%の裏側 - エージェント実行の66.2%が危険なまま完了していた 2026-08-01
- 🧭 GPT-5.6 Lunaの80%値下げで問い直すべきは単価ではなく工程設計 2026-08-01
- 🧪 AI生成テストの「写経オラクル」問題と、意味的オラクルを自動生成するPROGRESS 2026-08-01
- 🚨 AIの暴走課金はなぜ5か月気づかれないのか - Amazonの予算860%超過に学ぶ統制設計 2026-07-31
- 🚦 エージェントの誤行動を止めるのは賢さではなく配置 — 実行時データ品質ゲートSARC-DQ 2026-07-31
- 🧬 正解データなしでRAGを回帰テストする「メタモルフィックテスト」の考え方 2026-07-31
- 🛡 Skill導入前の悪性判定でLLM入力トークンを77%削減するSkillGateの構造 2026-07-30
- 🧩 AI生成コードの「暗黙の前提」を成果物にする — AssumptionMinerの読み解き 2026-07-29
- 🧪 実トラフィックから回帰テストを生成する: NL2Testの役割分担設計 2026-07-29
- 🗃️ 画面を見ないPC操作エージェント: StateActが示す状態基盤設計 2026-07-29
- 🔍 AIレビュー5万4791件の分析: 指摘が直される条件と直されない理由 2026-07-28
- 🧪 Skillのテストは何を漏らすか - Skill Test Coverageで未検証の運用義務を測る 2026-07-28
- 🧩 障害履歴を症状・原因・対処の三つ組で検索する OM-RAG の設計 2026-07-28
- 🔌 セッションと初期化ハンドシェイクを廃止したステートレス改訂 - MCP 2026-07-28 2026-07-27
- 🚧 無人公開のfail-closedゲートは、どの層に置くと効くのか 2026-07-27
- 🧪 正解データ不要でRAG検索の網羅性を測るテスト十分性基準 - Chunk Coverage 2026-07-25
- 🎯 多段エージェントで対象固定が誤操作を3倍に増幅する現象と対処 - Binding Drift 2026-07-23
- 🧪 安全機構を外したAI評価の封じ込め設計と責任の空白 2026-07-23
- 🧪 自己修正バイアスを防ぐ契約駆動のSkill評価CI - AEVAL 2026-07-22
- 🚦 リポジトリ内で反例を仕様へ昇格させるエージェント合成 - Counterexample-Supplemented Sketches 2026-07-21
- 🔍 PRの振る舞い差を露出させる変更誘導型テスト生成 - DiffTestGen 2026-07-21
- 🛡️ 長時間稼働エージェントの権限設計: 軌跡監視を支える4層構造 2026-07-21
- 🧩 シナリオ誘導で設計意図を絞る検証付き LLM 合成 - Concept Design と foundry 2026-07-21
- 🔐 エージェントの権限設計を OS 能力とユーザー同意の 2 軸で分解する 2026-07-20
- ⏳ エージェント記憶の鮮度設計 静かに嘘になる記憶をどう扱うか 2026-07-20
- 🧪 実装より先に評価系を設計する - AI生成コードの評価オラクル 2026-07-20
- 🪙 AI Tokenomics:コーディングのトークン効率を工程で設計する11原則 2026-07-19
- 🛡️ 自律AIエージェント攻撃に学ぶ、権限境界とインシデント対応の設計 2026-07-17
- 🛡️ GPT-Red解説:自己対戦レッドチームと、AIリリース判定の再設計 2026-07-16
- 🔁 AfterVibe - 会話履歴とコードから再生成可能な仕様を復元する手法 2026-07-15
- 🧪 技術調査 - AgentCheck:MCPツール障害を注入してエージェント耐性を測るワークベンチ 2026-07-15
- 🔧 技術調査 - 自動ハーネス適応で小型モデルを96%安く動かす 2026-07-14
- 🧩 テストもSASTも素通りするAI生成コードの構造破綻「Patchwork Problem」 2026-07-14
- 🧠 技術調査 - Memory in the Loop:エージェントのメモリをループ内に置く設計 2026-07-12
- 🧭 エージェント導入を「作る前」に潰す20の問い — Google Cloudの設計レビュー枠組み 2026-07-11
- 🔍 Copilot code review はなぜ共有ツールで悪化したか - ツール指示を仕事に合わせる 2026-07-11
- 🧬 技術調査 - ハーネスを実行時に進化させる Test-Time Harness Evolution 2026-07-11
- 🛡️ 社内RAG乱立を収束させる全社基盤の設計 承認・認可・品質ゲートを組み込む 2026-07-10
- 💎 技術調査 - Progressive Crystallization(エージェント探索の決定論化) 2026-07-10
- 🚪 技術調査 - 全社AIゲートウェイ(Internal Key方式の入口プロキシ) 2026-07-09
- ⚖️ 「AIはもう十分賢い」の先へ 評価・ガバナンスへの投資シフトを検証する 2026-07-07
- 🔍 AIを実装要員でなく「リリース前監査役」に置く出荷判断の型 2026-07-06
- 🔍 AIに障害対応させる前に設計すべき、証拠捏造を見抜く検証プロトコル 2026-07-05
- 🛡️ AIネイティブ開発組織のリスクアーキテクチャ再設計 — 確率的エージェントの失敗を誰が止めるか 2026-07-04
- 🚧 技術調査 - UnderSpecBench: 曖昧なDevOps指示でAIエージェントの行動時55〜68%が境界逸脱 2026-07-04
- 🚦 最上位モデルが止まる前提の可用性設計:発注側が織り込む4項目 2026-07-03
- 🔧 Claude Sonnet 5 移行で壊れるAPI前提と運用破断点の棚卸し 2026-07-02
- 🛡️ Google Cloud の自律SDLCセキュリティ — AIで脆弱性を発見・検証・修正する閉ループ設計 2026-06-30
- 🗂️ 技術調査 - RAGの回答精度を左右する非構造データ継続パイプライン設計 2026-06-29
- 🗂️ Claude Code の指示をどこに書くか — 7つの指示面とコンテキスト負債の設計 2026-06-25
- 🧾 味の素の経理AIエージェントに学ぶ 承認業務をAIに委任する前提条件 2026-06-21
- 📊 技術調査 - GitHub 社内データ分析エージェント Qubot 2026-06-20
- 🕵️ 技術調査 - MosaicLeaks 2026-06-20
- 🛡️ 技術調査 - Cloudflare 脆弱性探索ハーネス (VDH/VVS) 2026-06-19
- 🧹 技術調査 - AGENTS.md・CLAUDE.md 設定ファイルの設計臭6分類 2026-06-17
- 🛡️ AIモデルが突然使えなくなる日に備える モデル可用性BCPの設計 2026-06-14
- 🤖 技術調査 - Trinity(自己ホスト型 AI エージェント運用基盤) 2026-06-14
- 🚦 能力制限付きルーティング — Fable 5 に学ぶLLMゲートウェイ設計 2026-06-13
- 🔑 技術調査 - GitHub Secret Scanning の後段 LLM 文脈検証 2026-06-12
- ✂️ 技術調査 - 長時間エージェントのコンテキスト設計(Less Context, Better Agents) 2026-06-11
- 🧪 技術調査 - TestMap:AI生成テストを証拠付きで評価する基盤設計 2026-06-11
- 🛡️ 技術調査 - 悪性 Agent Skill を実行時検証する MalSkillBench 2026-06-09
- 🎛️ 本番AIエージェントは「自律性」より「制御可能性」で動く—実証研究MAPを読む 2026-06-09
- 🔍 Alibaba Open Code Review:「LLMに行番号を出させない」AIレビュー設計 2026-06-08
- 💸 Cloudflare AI Gateway「Spend Limits」を解剖する — AIの権限委任をドル建て予算で設計する 2026-06-06
- 🧠 技術調査 - OpenAI Dreaming に学ぶAIエージェント記憶設計の6区分 2026-06-06
- ✅ 受け入れテスト駆動でLLMを評価する — 業務要件をリリースゲート化するATDLLMD拡張 2026-06-04
- 🗂️ 技術調査 - Agents Schema 2026-06-04
- 🧠 AIエージェントの長期記憶アーキテクチャ 記憶のライフサイクル管理という設計論 2026-06-04
- 🛡️ Thoughtworks - AI Assurance:Enterprise AIの品質保証を継続的リスク低減へ 2026-06-04
- 🛡️ 本番AIエンドポイントを推論盗用から守る多層防御とコスト境界の設計 2026-06-02
- 🧨 コーディングエージェントは何を壊すのか──運用安全性失敗547件の実証研究 2026-06-02
- 🔍 AI 評価レポートを「主張」と「証拠」に分けて書く - OpenAI 第三者評価 playbook を実装に落とす 2026-05-30
- 🛡️ 技術調査 - Cloudflare Town Lake / Skipper(監査可能なNL-SQLエージェント) 2026-05-29
- 🔁 状態を持つアプリをLLMエージェントに操作させるトランザクション設計と適用限界 2026-05-27
- 🧪 技術調査 - agent-breakage: 自律K8s運用エージェントを反証可能に測る基盤 2026-05-26
- 🔌 技術調査 - Codex App Server 2026-05-21
- 🛡️ 技術調査 - Unsafe by Flow / MCP-BiFlow 2026-05-12
- 📑 技術調査 - LLMエージェント時代の上場企業データインフラ設計 2026-05-11
- 🧰 技術調査 - DADL (Dunkel API Description Language) 2026-05-09
- 🧪 非決定的な AI エージェントの検証 - PTA + Dominator で Trust Layer を構築する 2026-05-08
- 🤖 技術調査 - Hermes Agent 2026-05-04
- 🚦 ホスト型 LLM のサイレント更新を CI/CD でゲートする - Test-Before-You-Deploy フレームワーク実践ガイド 2026-05-02
- 🦾 技術調査 - harness 2026-04-21
- 📝 技術調査 - markitdown 2026-04-13
- 🔍 技術調査 - Jina Reader 2026-04-04
- ⚡ 技術調査 - Agent Lightning 2026-02-19
- 🤝 AIコーチングの現在 2025-10-25
- 🤖 技術調査 - PR-Agent 2025-08-18
- 🤖 技術調査 - Serena MCP 2025-08-08
- 🧠 コンテキストエンジニアリング入門:AIに何を渡すかをシステムとして設計する 2025-07-20
- 🚀 RAGの精度が出ない...は卒業。グラフDBで 文脈の時系列 を捉える高機能RAGバックエンド「local-RAG-backend」 2025-06-22
- 🛠️ 技術調査 - Unstructured 2025-06-19
- 🕸️ 技術調査 - Graphiti 2025-06-05
- 🚀 プロンプトエンジニアリングの進化 - 人間中心からAIエージェントへ 2025-05-29
- 🧩 既存環境からterraformにリバースエンジニアリングする流れとツールの使い所 2025-05-22
- ⚙️ 技術調査 - RAGの精度向上戦略 2025-05-16