1年目向けエンジニア新聞通勤15分で読み切る、毎朝のAI・技術ニュース
記事を探す

論文・研究

全50記事

論文・研究

難問を解けないLLM強化学習に「Never Give Up」

LLMの強化学習(RL)では、簡単な問題では大きな性能向上が得られる一方、難しい問題には効果が限定的だという「Matthew Effect in RL」という現象が指摘されています。これに対処するため、著者らは正解が得られるまでサンプル…

論文・研究

LLMのsemver制約理解度を測るベンチマーク

SemVerBenchは、LLMがソフトウェアのバージョン制約(例: ^1.2.3や>=2.0,<3)の解決意味論をどれだけ正確に理解しているかを測定する、初のベンチマークを提案する論文です。著者はQibai Chen氏とZeming…

論文・研究

アクセスなしでMCPサーバーの脆弱性を検出

この論文は、MCP(Model Context Protocol。AIエージェントが外部ツールと連携するための規格)サーバーの間接的プロンプトインジェクション脆弱性を、実際のシステムへのアクセスや実行時の相互作用なしに、ツールの機能メタ…

論文・研究

統計力学でAIエージェント群の集団行動を予測

Batu El氏ら10名による論文「Physics of Agents」です。1万以上のコミュニティに属するLLMエージェントを観察し、数学問題や政治的声明について意見を交換・修正させる実験を行い、統計力学の枠組みを適用した動的モデルを…

論文・研究

エージェントAIを外部から自動レッドチーミング

Divyanshu Kumar氏ら5名による論文です。内部構造にアクセスせず、基本的なシステム説明のみを入力としてリスクを洗い出す「ブラックボックス型レッドチーミング」を提案しています。観察可能な行動をリスク分類にマッピングする7領域の…