長期タスクのスキル実行、サブエージェント方式が優位に
長期タスクをこなすLLMエージェントが、再利用可能な知識(スキル)をどう実行すべきかを検証した論文です。著者はWasu Top Piriyakulkij氏ら5名で、2026年9月7日にarXivへ投稿されました。従来、スキル指示をエージ…
全50記事
長期タスクをこなすLLMエージェントが、再利用可能な知識(スキル)をどう実行すべきかを検証した論文です。著者はWasu Top Piriyakulkij氏ら5名で、2026年9月7日にarXivへ投稿されました。従来、スキル指示をエージ…
訓練データが限られる小規模言語モデルにおいて、パラメータ数を増やす代わりに少数のパラメータ層を繰り返し適用して計算量を増やす手法を提案する論文です。著者はTingshuo Fan氏ら5名。マスク付き次トークン予測と因果言語モデリングの目…
Hoyeol Yang氏ら6名による論文は、14種類のLLMを対象に、ウェブ検索、LLMサブエージェントへの委譲、コード実行という3種類のツールから返される情報を意図的に破損させ、エージェントがその不正確な情報をどれだけ最終回答に採用し…
Leonard TwagirayezuとPrasenjit Mitraによる論文は、大規模言語モデルをエネルギー効率よく配置するため、推論に不可欠な回路(reasoning circuits)を特定して保護しつつ、それ以外の部分を圧縮す…
既存のMLLM(マルチモーダル大規模言語モデル)は一般的な視覚理解タスクには強い一方、「2つの類似画像間の差異を特定する」という基本的な比較能力に弱点があるという問題意識のもと、研究チームは新ベンチマーク「VDiff-Bench」を提案…
Google DeepMindの研究者が、Gemini 3.1 Proを搭載したAIエージェント100体に、未解決問題を含む71個の数学問題を解かせる実験を行いました。実験開始から1時間で37問が解かれたものの、自動採点プログラムに正規…
AI創薬企業Insilico Medicineが、AIが設計した薬「レントセルチブ(Rentosertib)」により人間の生物学的年齢が若返ったとする研究結果をNature Biotechnologyに発表しました。この薬はもともと特発…
「HarvestBench」という新しいベンチマークを提案する論文です。農場シミュレーション上で2台のトラクターが穀物を収穫する設定において、動物がトラクターの経路を塞いだ場合にLLMエージェントが「そのまま進む(燃料コスト無し)」か「…
Wes Sander氏が開発した「Discovery Loop」という軽量システムに関する論文です。LLMがシンプルなソルバーから出発し、スコアボードと過去のアイデア履歴を参照しながら改善案を反復的に提案・進化させる仕組みで、単位正方形…
AIエージェントのメモリ(会話履歴や知識)が、LLMモデルをアップグレードした際にどれだけ引き継げるかを検証した論文です。新しいモデルは旧モデルが作ったメモ書きの解釈が異なったり、埋め込み(embedding)のバージョン混在が検索精度…
arXivに投稿された論文「Large-Language Models as a Cognitive Virus」は、LLMの普及をウイルスの比喩でモデル化しています。著者はRicard Solé氏ら9名で、社会内でのLLM利用の広がり…
この論文は、セッション開始・ツール呼び出し・ファイル編集などの実行時イベントに紐づく「ライフサイクルフック」を持つAIエージェントハーネスに新たな攻撃表面があることを示しています。攻撃者がプラグインのメタデータやフック設定を操作できるサ…
「PatchBench: Evaluating AI Agents for Vulnerability Patching」は、AIエージェントによる自動脆弱性パッチ生成の既存評価手法に問題があると指摘する論文です。既存評価はPoC(概念…
分散LLMエージェントシステムでは、状態(メモリ)が最新であっても、そこから導出された「計画」自体が古くなり無効になる「stale-plan execution」問題が生じ得ます。本論文はこれに対処するため、計画が依拠する公開記録を明示…
論文「Speculative Macro Commit for Faster Tool-Using Agents」(Zeyu Liu氏ら、MLSP2026採択)は、ツール使用型LLMエージェントの待ち時間が、モデル推論だけでなく行動→観…
論文「DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training」(Shubham Gandhi氏ら)は、プログラ…
論文「The Natural Language Interaction Protocol and Standard for AI Agents」(Luyi Xing氏ら12名、ACM AI Summit 2026採択)は、異種のエージェ…
「Long-Horizon State Tracking in LLMs: Executing MD5 through a Deep Sequence of Dependent Tool Calls」という論文(著者: Dheeraj…
「The Emergent Symbolic Structure of Artificial Neural Networks」(著者: R. Thomas McCoy、Paul Soulos、Tal Linzen、Paul Smolen…
「ChatDev 2.0: A No-Code Multi-Agent Platform for Developing Everything」(著者9名、筆頭著者Yufan Dang)は、LLMベースのマルチエージェントシステム(MAS…
本論文は、LLMを評価者として用いる際の特性を分析するため、心理測定学のラッシュ測定理論(RMT)を応用しています。LLMはベンチマークの採点対象、他モデルの判定者(LLM-as-judge)、人間生成コンテンツの評価者として評価の多く…
大規模言語モデルや高度なAIエージェントが危険性のある環境で運用される際のアライメント課題を、ゲーム理論の視点から整理したサーベイ論文です。既存手法の限界を踏まえ、複数の利害関係者間の「選好の多様性」、競合する目標間の「アライメント優先…
カリフォルニア大学バークレー校のTsung-Han Wuらによる「CoVA-SFT」は、マルチモーダル言語モデルにテキストだけでなく図やレイアウトなどの視覚的抽象化を組み合わせた推論(Chain of Visual Abstractio…
論文「CAST: Critique-Aware Supervision for Training Reliable Long-Horizon Tool-Calling Agents」は、長期にわたるツール呼び出しエージェントの信頼性向上…