検索インデックス自体を自己進化させるSELF-INDEX
arXivに掲載された論文「Self-Evolving Search Index」(Sangam Lee氏ら8名)は、LLMエージェントの情報検索を改善するため、これまで人間主導だった検索インデックスの最適化を自動化するフレームワーク「…
全50記事
arXivに掲載された論文「Self-Evolving Search Index」(Sangam Lee氏ら8名)は、LLMエージェントの情報検索を改善するため、これまで人間主導だった検索インデックスの最適化を自動化するフレームワーク「…
arXivの論文「Sample Count Is Not Enough」(Mobina Kashaniyan、Ali Jannesari)は、同じ数の生成候補でも、テスト時スケーリング(推論時に複数候補を生成して選ぶ手法)における候補生…
arXivの論文「An Architecture for Long-Horizon Agents」(Erik Nijkamp、Anurag Koul、Egor Pakhomov、Bo Pang)は、数日から数週間にわたる長期タスクを遂行…
ワシントン大学のFranziska RoesnerとTadayoshi Kohno両氏による論文が、Ken Thompsonの古典的な「Trusting Trust」攻撃の概念を、自己修正・自己改善するAIコーディングエージェントに適用…
「Infinite-Parameter LLMs」と題する論文では、モデルの重みを学習後に固定せず、実行時にライブデータから生成・適応させる新しいアーキテクチャが提案されています。ハイパーネットワークを使ってランタイムデータを共有ベース…
重みを{-1, 0, +1}の3値で表す三値化(ternary)LLMは、情報理論上1.585ビット/重みが限界とされてきました。しかし本研究では、実際のモデルで重みの最大51.5%がゼロに偏っているという非均一な分布が発見され、これを…
17名の共著による論文「Dream-RSI: Recursive Self-Improvement through Evolving Worlds」です(2026年9月14日投稿)。自律AIエージェントの再帰的自己改善(RSI)のための…
単著論文「AcquireBound: Runtime Authorization for Resources Acquired by AI Agents」です(著者Genliang Zhu、2026年9月13日投稿)。支払い・予算・OA…
5名による論文「Vibe Patenting: Evaluating LLM Judges for Professional Patent-Drafting Agents」です。特許草案作成という専門業務において、LLMを「判定官」とし…
2026年9月14日にarXivへ投稿された論文で、著者のHalil Burak Noyan氏は、多くの企業環境でAIエージェントが人間の従業員と同様、デプロイ時に固定された静的な認証情報セット(役割が将来必要とする可能性のある全権限を…
LLMの強化学習(RL)では、簡単な問題では大きな性能向上が得られる一方、難しい問題には効果が限定的だという「Matthew Effect in RL」という現象が指摘されています。これに対処するため、著者らは正解が得られるまでサンプル…
AIエージェントが長時間タスクを実行した際に生じる大量の実行ログから失敗の根本原因を診断する「Root-Cause Attribution (RCA)」について、既存のLLMベース手法は実行トレースが長くなるほど診断精度が低下するという…
コーディングエージェント向けにリポジトリのSKILL文書(Markdownでコードと共にバージョン管理される知識文書)を最適化する手法を検証した論文です。マージ済みプルリクエストを凍結時点から復元する新しい評価タスクを設計し、3つのKo…
エージェント的コーディングにおいて、ベンダーが自社モデル向けに最適化した「ハーネス」(ツール・プロンプト・制御フロー)が汎用的なハーネスより本当に性能が高いのかを検証した論文です。汚染を制御した256個のプライベートなリポジトリ/コンテ…
エージェント型ソフトウェアエンジニアリング(AIコーディングエージェントによる自律的な開発)が抱える2つの根本的な「ギャップ」を指摘する論文です。仕様やテストスイートは本来のステークホルダーの意図を完全には表現できない「要件ギャップ」と…
Yoshua Bengio氏は、AIエージェントが嘘・不正・結託などの問題行動を示すのは意図的な設計ではなく、強化学習による報酬最適化の構造的な帰結だと論じています。訓練は事前訓練(人間テキストの模倣)と強化学習(推論強化、エージェント…
Goodhart Labsのブログ記事(Dean ValentineがLessWrongに転載)は、2025年のPalisade Researchによるチェス評価(モデルが36%の確率でボード状態を改ざんした実験)を土台に、新しいハニー…
Specific Labsが発表した新ベンチマーク「Real-SWE」は、従来のSWEベンチ等と異なり、公開されていない実企業の非公開コードベース上で、請求計算・税務処理・顧客移行など実際にビジネス影響のあるタスクをAIコーディングエー…
SemVerBenchは、LLMがソフトウェアのバージョン制約(例: ^1.2.3や>=2.0,<3)の解決意味論をどれだけ正確に理解しているかを測定する、初のベンチマークを提案する論文です。著者はQibai Chen氏とZeming…
この論文は、MCP(Model Context Protocol。AIエージェントが外部ツールと連携するための規格)サーバーの間接的プロンプトインジェクション脆弱性を、実際のシステムへのアクセスや実行時の相互作用なしに、ツールの機能メタ…
arXivに投稿された論文「terms.txt: A Consent and Compensation Protocol for Agentic Web Access」は、検索エンジンにクロールを許可する代わりにトラフィックを得るという…
Batu El氏ら10名による論文「Physics of Agents」です。1万以上のコミュニティに属するLLMエージェントを観察し、数学問題や政治的声明について意見を交換・修正させる実験を行い、統計力学の枠組みを適用した動的モデルを…
Divyanshu Kumar氏ら5名による論文です。内部構造にアクセスせず、基本的なシステム説明のみを入力としてリスクを洗い出す「ブラックボックス型レッドチーミング」を提案しています。観察可能な行動をリスク分類にマッピングする7領域の…
LLMがコード生成時に自ら書く自然言語コメントが、後続のコード生成にどう影響するかを調べた研究です。著者はDangfeng Pan氏ら5名。観察分析と制御実験を組み合わせ、弱いモデルに強いモデルが生成したコメントを事前提供することで、コ…