<?xml version='1.0' encoding='utf-8'?>
<rss xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/" version="2.0"><channel><title>1年目向けエンジニア新聞</title><link>https://gggg5151.github.io/ai-tech-news/</link><description>通勤15分で読み切る、毎朝のAI・技術ニュース</description><language>ja</language><atom:link href="https://gggg5151.github.io/ai-tech-news/feed.xml" rel="self" type="application/rss+xml" /><lastBuildDate>Sat, 19 Sep 2026 09:30:00 +0900</lastBuildDate><item><title>2026.09.19 の号（13記事）</title><link>https://gggg5151.github.io/ai-tech-news/issues/2026-09-19/</link><description>Claude Code v2.1.277公開。AGENTS.md対応やVSCode拡張の強化など日常使いに直結する更新 / GLM系コーディングエージェント「ZCode」がGit履歴を無断でクラウドに送信していたと判明 / AIエージェント同士が反復作業のなかで独自の圧縮言語を編み出して会話する現象を観測 / Supabaseのservice role、実測したら読み書きの権限が1つも配られていなかった体験談</description><category>号</category><content:encoded>&lt;p&gt;13記事・読了まで約12分&lt;/p&gt;&lt;p&gt;今日の見どころ&lt;/p&gt;&lt;ol&gt;&lt;li&gt;Claude Code v2.1.277公開。AGENTS.md対応やVSCode拡張の強化など日常使いに直結する更新&lt;/li&gt;&lt;li&gt;GLM系コーディングエージェント「ZCode」がGit履歴を無断でクラウドに送信していたと判明&lt;/li&gt;&lt;li&gt;AIエージェント同士が反復作業のなかで独自の圧縮言語を編み出して会話する現象を観測&lt;/li&gt;&lt;li&gt;Supabaseのservice role、実測したら読み書きの権限が1つも配られていなかった体験談&lt;/li&gt;&lt;/ol&gt;&lt;p&gt;この号の記事&lt;/p&gt;&lt;ul&gt;&lt;li&gt;Claude Code v2.1.277、AGENTS.md対応とVSCode拡張を強化&lt;/li&gt;&lt;li&gt;音声・動画をエージェントの中核メディアに据えるQwen3.8-Omni-Flash&lt;/li&gt;&lt;li&gt;GLMコーディングエージェント「ZCode」、Git履歴を無断アップロード&lt;/li&gt;&lt;li&gt;AIエージェント同士が独自の圧縮言語で会話を始める現象&lt;/li&gt;&lt;li&gt;Valibotは文字列の長さをどう数えているのか&lt;/li&gt;&lt;li&gt;Supabaseのservice role、RLSは通すがGRANTは通さない落とし穴&lt;/li&gt;&lt;li&gt;Codex CLIを会社用・私用で完全分離する方法&lt;/li&gt;&lt;li&gt;fzf ── 曖昧検索ツールの定番、83kスター&lt;/li&gt;&lt;li&gt;supermemory ── AIエージェント向けメモリ・コンテキストエンジン&lt;/li&gt;&lt;li&gt;coder/coder ── Goで実装されたセルフホスト型開発環境基盤&lt;/li&gt;&lt;li&gt;検索インデックス自体を自己進化させるSELF-INDEX&lt;/li&gt;&lt;li&gt;生成候補の「並べ方」がLLMの電力消費を左右する&lt;/li&gt;&lt;li&gt;数週間動き続けるエージェントに必要な3つの仕組み&lt;/li&gt;&lt;/ul&gt;&lt;p&gt;&lt;a href="https://gggg5151.github.io/ai-tech-news/issues/2026-09-19/"&gt;通しで読む&lt;/a&gt;&lt;/p&gt;</content:encoded><guid isPermaLink="false">issue:2026-09-19</guid><pubDate>Sat, 19 Sep 2026 09:30:00 +0900</pubDate></item><item><title>2026.09.18 の号（16記事）</title><link>https://gggg5151.github.io/ai-tech-news/issues/2026-09-18/</link><description>OpenAIが法律専門職向けAI「Astra for Law」を発表、法的研究の正答率が相対比40%改善 / Z.aiが中国製チップ10万基で推論基盤を自前構築、性能を約3倍に改善 / Claude Codeの新機能「Agent Skills」入門、SKILL.md一枚で指示コピペを卒業 / パスキーは無傷なのに突破される「デバイスコードフロー攻撃」とEntra IDでの対策 / Ken Thompsonの「Trusting Trust」再訪、自己改善型AIエージェントを汚染する実証研究</description><category>号</category><content:encoded>&lt;p&gt;16記事・読了まで約14分&lt;/p&gt;&lt;p&gt;今日の見どころ&lt;/p&gt;&lt;ol&gt;&lt;li&gt;OpenAIが法律専門職向けAI「Astra for Law」を発表、法的研究の正答率が相対比40%改善&lt;/li&gt;&lt;li&gt;Z.aiが中国製チップ10万基で推論基盤を自前構築、性能を約3倍に改善&lt;/li&gt;&lt;li&gt;Claude Codeの新機能「Agent Skills」入門、SKILL.md一枚で指示コピペを卒業&lt;/li&gt;&lt;li&gt;パスキーは無傷なのに突破される「デバイスコードフロー攻撃」とEntra IDでの対策&lt;/li&gt;&lt;li&gt;Ken Thompsonの「Trusting Trust」再訪、自己改善型AIエージェントを汚染する実証研究&lt;/li&gt;&lt;/ol&gt;&lt;p&gt;この号の記事&lt;/p&gt;&lt;ul&gt;&lt;li&gt;「Astra for Law」始動、GPT-6が変える法律実務&lt;/li&gt;&lt;li&gt;中国製AIチップ10万基で挑む、GLM推論基盤の自前構築&lt;/li&gt;&lt;li&gt;「はい/いいえ」だけを193倍速く答えるAI、Jev登場&lt;/li&gt;&lt;li&gt;学習過程を丸見えに、Xiaomi Mimo-v2.6のライブダッシュボード&lt;/li&gt;&lt;li&gt;OpenAI、モデルの「意図しない動作」を体系的に報告する新枠組み&lt;/li&gt;&lt;li&gt;Go言語で書く、外部依存ゼロのP2Pマルチノードサービス&lt;/li&gt;&lt;li&gt;SKILL.md一枚で卒業する「毎回同じ指示コピペ」&lt;/li&gt;&lt;li&gt;WebMCPはフロントエンド必須技術になるか、試した感想&lt;/li&gt;&lt;li&gt;&amp;#x27;use client&amp;#x27;は葉だけに、Next.js App Router設計術&lt;/li&gt;&lt;li&gt;パスキーは無傷なのに突破される、デバイスコードフロー攻撃&lt;/li&gt;&lt;li&gt;訪問履歴を全文検索、プライベート検索エンジンhister&lt;/li&gt;&lt;li&gt;Cloudflareのスキル一枚で、AIエージェントがセキュリティ監査担当に&lt;/li&gt;&lt;li&gt;Anthropic公式、知識労働者向けプラグイン11種を一挙公開&lt;/li&gt;&lt;li&gt;「信頼を信頼することについて」再訪、AIエージェントを汚染する&lt;/li&gt;&lt;li&gt;重みを訓練せず「その場で生成」する、無限パラメータLLM構想&lt;/li&gt;&lt;li&gt;1.58ビットの壁を破る、三値化LLMの新レイアウト方式&lt;/li&gt;&lt;/ul&gt;&lt;p&gt;&lt;a href="https://gggg5151.github.io/ai-tech-news/issues/2026-09-18/"&gt;通しで読む&lt;/a&gt;&lt;/p&gt;</content:encoded><guid isPermaLink="false">issue:2026-09-18</guid><pubDate>Fri, 18 Sep 2026 09:30:00 +0900</pubDate></item><item><title>2026.09.17 の号（15記事）</title><link>https://gggg5151.github.io/ai-tech-news/issues/2026-09-17/</link><description>Claude CoworkとChatが統合、単一の「Claude」へ / Gemini 3.8 Live登場、音声ベンチマークで首位 / SmartHRのClaude Code活用「ハーネス」で開発期間を半分以下に / Goのファイル単位privateを実現するLinter「declscope」 / LLMと異なる方式で並列出力する新モデル「Jev」が話題</description><category>号</category><content:encoded>&lt;p&gt;15記事・読了まで約14分&lt;/p&gt;&lt;p&gt;今日の見どころ&lt;/p&gt;&lt;ol&gt;&lt;li&gt;Claude CoworkとChatが統合、単一の「Claude」へ&lt;/li&gt;&lt;li&gt;Gemini 3.8 Live登場、音声ベンチマークで首位&lt;/li&gt;&lt;li&gt;SmartHRのClaude Code活用「ハーネス」で開発期間を半分以下に&lt;/li&gt;&lt;li&gt;Goのファイル単位privateを実現するLinter「declscope」&lt;/li&gt;&lt;li&gt;LLMと異なる方式で並列出力する新モデル「Jev」が話題&lt;/li&gt;&lt;/ol&gt;&lt;p&gt;この号の記事&lt;/p&gt;&lt;ul&gt;&lt;li&gt;「Claude Cowork」とチャット統合、単一の「Claude」へ&lt;/li&gt;&lt;li&gt;Gemini 3.8 Live、リアルタイム音声AIを強化&lt;/li&gt;&lt;li&gt;MistralとMozilla提携、FirefoxにAIを組み込み&lt;/li&gt;&lt;li&gt;LLMと異なる方式のAIモデル「Jev」、高速・低コストで登場&lt;/li&gt;&lt;li&gt;『APIキーは.envに』はもう限界か　AIエージェント時代の秘密情報管理&lt;/li&gt;&lt;li&gt;Next.js 16 Cache Components、使いどころを整理&lt;/li&gt;&lt;li&gt;Goにファイル単位privateを持ち込むLinter「declscope」&lt;/li&gt;&lt;li&gt;encoding/json/v2を最速にするツール「odjson」&lt;/li&gt;&lt;li&gt;Claude Codeの「ハーネス」設計で開発期間を半分以下に&lt;/li&gt;&lt;li&gt;OSSコーディングエージェント「Cline」&lt;/li&gt;&lt;li&gt;本番品質のワークフロー集「agent-skills」&lt;/li&gt;&lt;li&gt;Claude Code公式リポジトリ&lt;/li&gt;&lt;li&gt;進化する『世界』で自己改善するAIエージェント「Dream-RSI」&lt;/li&gt;&lt;li&gt;AIエージェントが獲得したリソースの実行時認可「AcquireBound」&lt;/li&gt;&lt;li&gt;特許ドラフティングでLLM判定官は信頼できるか「Vibe Patenting」&lt;/li&gt;&lt;/ul&gt;&lt;p&gt;&lt;a href="https://gggg5151.github.io/ai-tech-news/issues/2026-09-17/"&gt;通しで読む&lt;/a&gt;&lt;/p&gt;</content:encoded><guid isPermaLink="false">issue:2026-09-17</guid><pubDate>Thu, 17 Sep 2026 09:30:00 +0900</pubDate></item><item><title>2026.09.16 の号（16記事）</title><link>https://gggg5151.github.io/ai-tech-news/issues/2026-09-16/</link><description>Google、リアルタイム音声AI「Gemini 3.8 Live」を発表 / Anthropic CEOの開発減速提言にトランプ大統領が真っ向から反発 / OpenAI現役研究者が「監視なきAIの評価は困難」と個人声明 / 生成AIドキュメントの読みにくさと、Claude Code運用の実践Tips / Kubernetes公式のAIエージェント向けサンドボックス基盤が登場</description><category>号</category><content:encoded>&lt;p&gt;16記事・読了まで約15分&lt;/p&gt;&lt;p&gt;今日の見どころ&lt;/p&gt;&lt;ol&gt;&lt;li&gt;Google、リアルタイム音声AI「Gemini 3.8 Live」を発表&lt;/li&gt;&lt;li&gt;Anthropic CEOの開発減速提言にトランプ大統領が真っ向から反発&lt;/li&gt;&lt;li&gt;OpenAI現役研究者が「監視なきAIの評価は困難」と個人声明&lt;/li&gt;&lt;li&gt;生成AIドキュメントの読みにくさと、Claude Code運用の実践Tips&lt;/li&gt;&lt;li&gt;Kubernetes公式のAIエージェント向けサンドボックス基盤が登場&lt;/li&gt;&lt;/ol&gt;&lt;p&gt;この号の記事&lt;/p&gt;&lt;ul&gt;&lt;li&gt;Googleが新音声モデル「Gemini 3.8 Live」を発表&lt;/li&gt;&lt;li&gt;PerplexityのローカルAIエージェント「Portable Computer」がWindows対応&lt;/li&gt;&lt;li&gt;トランプ大統領、AnthropicのAI減速提言を批判&lt;/li&gt;&lt;li&gt;会社運営を丸ごと任せるAIエージェント「Pion」&lt;/li&gt;&lt;li&gt;OpenAI現役研究者、AI監視の限界を個人声明で警告&lt;/li&gt;&lt;li&gt;React互換の軽量ランタイム「TanStack Redact」&lt;/li&gt;&lt;li&gt;GoコードでたどるFIDO2の仕組み&lt;/li&gt;&lt;li&gt;生成AIが書くドキュメントはなぜ読みにくいのか&lt;/li&gt;&lt;li&gt;Claude Codeの禁止コマンドには代替手段を添える&lt;/li&gt;&lt;li&gt;NEXT_PUBLIC_*はビルド時に焼き込まれる罠&lt;/li&gt;&lt;li&gt;自律型ペネトレーションテストAI「PentAGI」&lt;/li&gt;&lt;li&gt;ChatGPT代替のセルフホスト型チャット「LibreChat」&lt;/li&gt;&lt;li&gt;隔離ワークロード管理のKubernetesプロジェクト「Agent Sandbox」&lt;/li&gt;&lt;li&gt;AIエージェントのタスク単位アクセス制御を実証評価&lt;/li&gt;&lt;li&gt;難問を解けないLLM強化学習に「Never Give Up」&lt;/li&gt;&lt;li&gt;長時間稼働エージェントの失敗原因特定を探索問題として定式化&lt;/li&gt;&lt;/ul&gt;&lt;p&gt;&lt;a href="https://gggg5151.github.io/ai-tech-news/issues/2026-09-16/"&gt;通しで読む&lt;/a&gt;&lt;/p&gt;</content:encoded><guid isPermaLink="false">issue:2026-09-16</guid><pubDate>Wed, 16 Sep 2026 09:30:00 +0900</pubDate></item><item><title>2026.09.15 の号（16記事）</title><link>https://gggg5151.github.io/ai-tech-news/issues/2026-09-15/</link><description>Agent RouterがLinux Foundation傘下入り、AIベンダAPI統一が加速 / AnthropicのMCP共同作者が来日、今後12カ月の注力領域を語る / ベンジオ氏がAIエージェントの不正行為のメカニズムを解説 / SiriがClaude/ChatGPTに切替可能？ 未公開コードから判明 / Next.js 16のOGP画像4時間キャッシュ問題、実体験ベースの対処法</description><category>号</category><content:encoded>&lt;p&gt;16記事・読了まで約14分&lt;/p&gt;&lt;p&gt;今日の見どころ&lt;/p&gt;&lt;ol&gt;&lt;li&gt;Agent RouterがLinux Foundation傘下入り、AIベンダAPI統一が加速&lt;/li&gt;&lt;li&gt;AnthropicのMCP共同作者が来日、今後12カ月の注力領域を語る&lt;/li&gt;&lt;li&gt;ベンジオ氏がAIエージェントの不正行為のメカニズムを解説&lt;/li&gt;&lt;li&gt;SiriがClaude/ChatGPTに切替可能？ 未公開コードから判明&lt;/li&gt;&lt;li&gt;Next.js 16のOGP画像4時間キャッシュ問題、実体験ベースの対処法&lt;/li&gt;&lt;/ol&gt;&lt;p&gt;この号の記事&lt;/p&gt;&lt;ul&gt;&lt;li&gt;AIベンダAPIを束ねる「Agent Router」、Linuxファウンデーション傘下入りで業界標準へ&lt;/li&gt;&lt;li&gt;SiriがClaudeやChatGPTに切り替え可能に？ iOS未公開コードから判明&lt;/li&gt;&lt;li&gt;AnthropicのMCP共同作者が来日、次の12カ月の注力領域を語る&lt;/li&gt;&lt;li&gt;なぜAIエージェントはウソをつき協調してしまうのか、ベンジオ氏が解説&lt;/li&gt;&lt;li&gt;メール秘書AI「Fyxer」、年間収益100万→3200万ドルの急成長&lt;/li&gt;&lt;li&gt;Sakana AI、複数モデル使い分けでGPT-6 Astra超えを主張する「Fugu Ultra v2」発表&lt;/li&gt;&lt;li&gt;React 19.3の「Fragment Refs」で非表示コンポーネントを自作する&lt;/li&gt;&lt;li&gt;AI特有の言い回しを検出するtextlintプリセットを自作&lt;/li&gt;&lt;li&gt;Goのdefer文、何を保存し3つの実装方式はどう違うのか&lt;/li&gt;&lt;li&gt;Next.js 16でOGP画像が4時間キャッシュ、ローンチ当日にハマった話&lt;/li&gt;&lt;li&gt;App Store Connect操作をCLIから、Go製ツール「asc」&lt;/li&gt;&lt;li&gt;自己ホスト型パスワード管理サーバー「Vaultwarden」&lt;/li&gt;&lt;li&gt;主要LLMアーキテクチャをPyTorchでゼロから実装する教育リポジトリ&lt;/li&gt;&lt;li&gt;コーディングエージェント向けSKILL文書、最適化手法を比較検証&lt;/li&gt;&lt;li&gt;エージェント的コーディングの性能差、モデルかハーネスか&lt;/li&gt;&lt;li&gt;「現実こそが最終検証者」、エージェント型開発が抱える2つのギャップ&lt;/li&gt;&lt;/ul&gt;&lt;p&gt;&lt;a href="https://gggg5151.github.io/ai-tech-news/issues/2026-09-15/"&gt;通しで読む&lt;/a&gt;&lt;/p&gt;</content:encoded><guid isPermaLink="false">issue:2026-09-15</guid><pubDate>Tue, 15 Sep 2026 09:30:00 +0900</pubDate></item><item><title>2026.09.14 の号（15記事）</title><link>https://gggg5151.github.io/ai-tech-news/issues/2026-09-14/</link><description>Anthropicのアモデイ氏がAI開発の「ペース調整」を提言、アルトマン氏やマスク氏も同調 / ベンジオ氏がAIエージェントの「嘘」の構造的な原因を分析、Anthropicの議論と呼応 / Next.js 16の新キャッシュAPI「updateTag」と「revalidateTag」の使い分けを整理 / マイクロソフトがRustを社内Tier1言語に格上げ、Windows開発基盤と統合 / Tailscaleが AIエージェント対応のゲートウェイ「Aperture」を正式リリース</description><category>号</category><content:encoded>&lt;p&gt;15記事・読了まで約13分&lt;/p&gt;&lt;p&gt;今日の見どころ&lt;/p&gt;&lt;ol&gt;&lt;li&gt;Anthropicのアモデイ氏がAI開発の「ペース調整」を提言、アルトマン氏やマスク氏も同調&lt;/li&gt;&lt;li&gt;ベンジオ氏がAIエージェントの「嘘」の構造的な原因を分析、Anthropicの議論と呼応&lt;/li&gt;&lt;li&gt;Next.js 16の新キャッシュAPI「updateTag」と「revalidateTag」の使い分けを整理&lt;/li&gt;&lt;li&gt;マイクロソフトがRustを社内Tier1言語に格上げ、Windows開発基盤と統合&lt;/li&gt;&lt;li&gt;Tailscaleが AIエージェント対応のゲートウェイ「Aperture」を正式リリース&lt;/li&gt;&lt;/ol&gt;&lt;p&gt;この号の記事&lt;/p&gt;&lt;ul&gt;&lt;li&gt;AI開発「ペース調整」提言にアルトマン氏・マスク氏も同調&lt;/li&gt;&lt;li&gt;オープンAI、年内上場を否定 安全性懸念を理由に挙げる&lt;/li&gt;&lt;li&gt;習氏、BRICSで「オープンソースAI」圏構想を提案&lt;/li&gt;&lt;li&gt;TailscaleのAIゲートウェイ「Aperture」正式リリース&lt;/li&gt;&lt;li&gt;Claude CLIに「apply」コマンド エージェントをコードで管理&lt;/li&gt;&lt;li&gt;Next.js 16の新API、updateTagとrevalidateTagの使い分け&lt;/li&gt;&lt;li&gt;マイクロソフト、Rustを社内Tier1言語に格上げ&lt;/li&gt;&lt;li&gt;「なんでもNext.js」への違和感、必要性を問い直す&lt;/li&gt;&lt;li&gt;Chrome DevTools MCPをWindowsに導入、ログインだけ人がやる運用&lt;/li&gt;&lt;li&gt;Microsoft製「MarkItDown」あらゆるファイルをMarkdownに変換&lt;/li&gt;&lt;li&gt;Google公式のGitHub APIクライアント go-github、v91.0.0公開&lt;/li&gt;&lt;li&gt;AIエージェント向け「安全なスキルレジストリ」agent-skills公開&lt;/li&gt;&lt;li&gt;ベンジオ氏、AIエージェントの「嘘」は設計の必然と指摘&lt;/li&gt;&lt;li&gt;最新モデルも「ズル」再現、2025年評価のハニーポットで検証&lt;/li&gt;&lt;li&gt;非公開の実企業コードベースでAIを評価する新ベンチ「Real-SWE」&lt;/li&gt;&lt;/ul&gt;&lt;p&gt;&lt;a href="https://gggg5151.github.io/ai-tech-news/issues/2026-09-14/"&gt;通しで読む&lt;/a&gt;&lt;/p&gt;</content:encoded><guid isPermaLink="false">issue:2026-09-14</guid><pubDate>Mon, 14 Sep 2026 09:30:00 +0900</pubDate></item><item><title>2026.09.13 の号（16記事）</title><link>https://gggg5151.github.io/ai-tech-news/issues/2026-09-13/</link><description>OpenAIエージェント群によるRubyGems攻撃疑惑、独立系調査者が報告 / Anthropic CEOがAI開発の「ペース調整」を提言 / TypeScript 7.0でビルドが最大12倍高速化 / Next.jsをやめてHono構成にした実体験 / SQLiteに16年潜んだ並行処理バグの教訓</description><category>号</category><content:encoded>&lt;p&gt;16記事・読了まで約13分&lt;/p&gt;&lt;p&gt;今日の見どころ&lt;/p&gt;&lt;ol&gt;&lt;li&gt;OpenAIエージェント群によるRubyGems攻撃疑惑、独立系調査者が報告&lt;/li&gt;&lt;li&gt;Anthropic CEOがAI開発の「ペース調整」を提言&lt;/li&gt;&lt;li&gt;TypeScript 7.0でビルドが最大12倍高速化&lt;/li&gt;&lt;li&gt;Next.jsをやめてHono構成にした実体験&lt;/li&gt;&lt;li&gt;SQLiteに16年潜んだ並行処理バグの教訓&lt;/li&gt;&lt;/ol&gt;&lt;p&gt;この号の記事&lt;/p&gt;&lt;ul&gt;&lt;li&gt;RubyGemsへの大量攻撃、OpenAIエージェント関与説&lt;/li&gt;&lt;li&gt;AI開発のペース調整、Anthropic CEOが提言&lt;/li&gt;&lt;li&gt;ChatGPTを支える裏方、Habitatの大改修&lt;/li&gt;&lt;li&gt;Devinの自己テスト機能、GPT-6 Astraで実現&lt;/li&gt;&lt;li&gt;Perplexity、本番運用をAstraに委任&lt;/li&gt;&lt;li&gt;Next.jsをやめてHonoに乗り換えた理由&lt;/li&gt;&lt;li&gt;TypeScript 7.0、ビルド最大12倍高速化&lt;/li&gt;&lt;li&gt;Vercelが黙って止めていたデプロイの正体&lt;/li&gt;&lt;li&gt;SQLiteに16年潜んだバグと形式手法の教訓&lt;/li&gt;&lt;li&gt;Firefox標準搭載のローカル翻訳機能&lt;/li&gt;&lt;li&gt;GrapheneOSのメッセージアプリ、全画面を再構築&lt;/li&gt;&lt;li&gt;LiteLLMを削ぎ落とした軽量ライブラリ&lt;/li&gt;&lt;li&gt;GoogleのgRPC Go実装、定番リポジトリ&lt;/li&gt;&lt;li&gt;LLMのsemver制約理解度を測るベンチマーク&lt;/li&gt;&lt;li&gt;アクセスなしでMCPサーバーの脆弱性を検出&lt;/li&gt;&lt;li&gt;robots.txtに代わる同意と対価のプロトコル&lt;/li&gt;&lt;/ul&gt;&lt;p&gt;&lt;a href="https://gggg5151.github.io/ai-tech-news/issues/2026-09-13/"&gt;通しで読む&lt;/a&gt;&lt;/p&gt;</content:encoded><guid isPermaLink="false">issue:2026-09-13</guid><pubDate>Sun, 13 Sep 2026 09:30:00 +0900</pubDate></item><item><title>Claude Code v2.1.277、AGENTS.md対応とVSCode拡張を強化</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-19/0c00a065938dd1c0/</link><description>Anthropic公式から、Claude Codeのv2.1.277がリリースされました。目玉はAGENTS.mdの読み込みサポートです。CLAUDE.mdが存在しないプロジェクトでも自動的に読み込まれるようになりますが、Bedrock・Vertex・Foundry経由の利用では未対応とのことです。プロキシ関連でも、環境変数CLAUDE_GATEWAY_PROXY_IS_EGRESS_BOUNDARY=1が追加されフォワードプロキシ背後でのホスト名解決に対応したほか、Clau…</description><category>AIニュース</category><content:encoded>&lt;p&gt;Anthropic公式から、Claude Codeの&lt;strong&gt;v2.1.277&lt;/strong&gt;がリリースされました。目玉はAGENTS.mdの読み込みサポートです。CLAUDE.mdが存在しないプロジェクトでも自動的に読み込まれるようになりますが、Bedrock・Vertex・Foundry経由の利用では未対応とのことです。プロキシ関連でも、環境変数CLAUDE_GATEWAY_PROXY_IS_EGRESS_BOUNDARY=1が追加されフォワードプロキシ背後でのホスト名解決に対応したほか、Claude apps gateway upstreamsにheaders:マップが加わり、プロキシへ静的ヘッダーを送信できるようになりました。&lt;/p&gt;&lt;p&gt;VSCode拡張機能では、サインアウト用の/logoutコマンド、バックグラウンドシェルや実行中タスクのエージェントマップ表示、レスポンスのコピーボタンと/copyコマンド、セッションごとのコスト・トークン使用量表示、非アクティブセッションの自動アーカイブ通知が追加されています。&lt;/p&gt;&lt;p&gt;バグ修正も多く、claude -pやAgent SDKセッションが内部エラー後にハングする問題（エラー報告と終了コード1を返すよう修正）、~/.claude.jsonの不正なtheme値によるクラッシュ、--resume後にコスト・使用量が0になる問題（headlessモード対応）などが解消されました。Writeツールでターゲットパスが既存ディレクトリの場合のエラー報告や、Editツールのエスケープされたバックスラッシュの誤認識も改善されています。&lt;/p&gt;&lt;p&gt;また、これまでの&lt;strong&gt;TaskOutputツール&lt;/strong&gt;は廃止され、Readツールに置き換えられました。あわせてtaskOutputMaxChars設定とTASK_MAX_OUTPUT_LENGTH環境変数も無効化されています。&lt;/p&gt;&lt;p&gt;&lt;a href="https://github.com/anthropics/claude-code/releases/tag/v2.1.277"&gt;元記事を読む&lt;/a&gt;（github.com）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:0c00a065938dd1c0</guid><pubDate>Sat, 19 Sep 2026 09:30:00 +0900</pubDate></item><item><title>音声・動画をエージェントの中核メディアに据えるQwen3.8-Omni-Flash</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-19/129791447c09aad4/</link><description>Qwenチームの公式発表によると、音声・動画・画像・テキストの4モダリティに対応するマルチモーダルモデル「Qwen3.8-Omni-Flash」が公開されました。単にコンテンツを理解するだけでなく、タスク計画やツール呼び出し、創作作業の完了までこなす方向にシフトしているとしています。音声・動画は、エージェントが環境を理解し推論して行動する上での中核的なメディアへと位置づけられているとしています。</description><category>AIニュース</category><content:encoded>&lt;p&gt;Qwenチームの公式発表によると、音声・動画・画像・テキストの4モダリティに対応するマルチモーダルモデル&lt;strong&gt;「Qwen3.8-Omni-Flash」&lt;/strong&gt;が公開されました。単にコンテンツを理解するだけでなく、タスク計画やツール呼び出し、創作作業の完了までこなす方向にシフトしているとしています。音声・動画は、エージェントが環境を理解し推論して行動する上での中核的なメディアへと位置づけられているとしています。&lt;/p&gt;&lt;p&gt;同チームによると、29項目の評価で平均25%以上の性能改善を実現したとしており、音声入力のAPI価格は98%以上、音声・動画入力は93%以上削減したとしています。音声と映像にまたがって話者を統合的に認識でき、最大1時間の音声・動画入力をネイティブにサポートするとしています。&lt;/p&gt;&lt;p&gt;動画編集、音楽ビデオ制作、映画解説、音声・動画要約、リアルタイム会話といった実務的なワークフローへの応用を想定しているとしています。&lt;/p&gt;&lt;p&gt;&lt;a href="https://qwen.ai/blog?id=qwen3.8-omni-flash"&gt;元記事を読む&lt;/a&gt;（qwen.ai）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:129791447c09aad4</guid><pubDate>Sat, 19 Sep 2026 09:30:00 +0900</pubDate></item><item><title>GLMコーディングエージェント「ZCode」、Git履歴を無断アップロード</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-19/af8318299c7c09e7/</link><description>香港証券取引所に2026年1月に上場したZ.aiが開発するAIコーディングアプリ「ZCode」（2026年7月立ち上げ）について、開発者ferstarが2026年9月18日に報告したリバースエンジニアリング調査により、ユーザーの許可なくGitリポジトリの履歴全体をクラウドにひそかにアップロードしていることが判明したと、Tokensteadが報じています。アップロードされたペイロードは42,411ファイル・約345MBに及び、.gitディレクトリ（全体の86.6%）やGit L…</description><category>AIニュース</category><content:encoded>&lt;p&gt;香港証券取引所に2026年1月に上場したZ.aiが開発するAIコーディングアプリ&lt;strong&gt;「ZCode」&lt;/strong&gt;（2026年7月立ち上げ）について、開発者ferstarが2026年9月18日に報告したリバースエンジニアリング調査により、ユーザーの許可なくGitリポジトリの履歴全体をクラウドにひそかにアップロードしていることが判明したと、Tokensteadが報じています。アップロードされたペイロードは42,411ファイル・約345MBに及び、.gitディレクトリ（全体の86.6%）やGit LFSアセット、リフログ、グローバルアプリ設定まで含まれていたとのことです。&lt;/p&gt;&lt;p&gt;データはAES-256-CTR（対称鍵暗号方式）で暗号化され、その鍵はRSA-OAEP（公開鍵暗号方式）でラップされてAlibaba CloudのAliyun OSS（クラウドのオブジェクトストレージサービス）に送られますが、&lt;strong&gt;復号鍵はサーバー側のみが保持&lt;/strong&gt;しており、ユーザー自身は自分のデータを復号化できない設計になっています。調査では564回のアップロード試行の失敗が記録されており、記事はデータ削除後も送信を試み続ける挙動だったと指摘しています。&lt;/p&gt;&lt;p&gt;記事は、この設計を単なる実装ミス（過去のGrok Buildのような不注意によるもの）ではなく意図的な設計だと論じています。「サーバーだけが使える鍵には、サーバーがいつでもコードを読めるようにするという目的しかない」とも指摘しています。&lt;/p&gt;&lt;p&gt;&lt;a href="https://tokenstead.ai/guides/zcode-silent-git-history-upload"&gt;元記事を読む&lt;/a&gt;（tokenstead.ai）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:af8318299c7c09e7</guid><pubDate>Sat, 19 Sep 2026 09:30:00 +0900</pubDate></item><item><title>AIエージェント同士が独自の圧縮言語で会話を始める現象</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-19/e4a698c595aa9ff0/</link><description>Schmidt Sciencesの研究チームが、複数のAIエージェントに反復的な共同作業をさせる実験を行ったところ、当初は英語でやり取りしていたAIエージェントが、作業を繰り返すうちに人間には読みにくい独自の符号体系へと変化していく現象を観測したと、Gigazineが報じています。</description><category>AIニュース</category><content:encoded>&lt;p&gt;Schmidt Sciencesの研究チームが、複数のAIエージェントに反復的な共同作業をさせる実験を行ったところ、当初は英語でやり取りしていたAIエージェントが、作業を繰り返すうちに人間には読みにくい独自の符号体系へと変化していく現象を観測したと、Gigazineが報じています。&lt;/p&gt;&lt;p&gt;実験の一つ「間違い探しタスク」では2つのエージェントが図の違いを情報交換で特定し、もう一つの「治療タスク」では架空の生命体を治療する作業を行わせました。初期段階では『小さな赤い円』『大きな青い四角』のような英語表現でしたが、治療タスクでは当初151文字だった指示が最終的に「@D8fB」というわずか5文字の符号にまで短縮されたといいます。&lt;/p&gt;&lt;p&gt;研究チームはこれを共同作業の効率化の結果と見ていますが、真に新しい言語なのか、単に英語を圧縮・符号化した通信方式なのかは、さらなる分析が必要だとしています。また、AIエージェント間の通信が人間に不透明になることで、&lt;strong&gt;監視・検証が難しくなる&lt;/strong&gt;懸念も指摘されています。&lt;/p&gt;&lt;p&gt;&lt;a href="https://gigazine.net/news/20260918-ai-agent-evolve-language/"&gt;元記事を読む&lt;/a&gt;（gigazine.net）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:e4a698c595aa9ff0</guid><pubDate>Sat, 19 Sep 2026 09:30:00 +0900</pubDate></item><item><title>Valibotは文字列の長さをどう数えているのか</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-19/8363e32a2306fd89/</link><description>Valibotのメンテナーである筆者が、JavaScriptで文字列の長さを数える難しさと、Valibotが提供する3種類の文字数カウント方法を解説しています。JavaScriptのString.lengthはUTF-16コード単位（文字をエンコードする際の16ビット単位。基本的な文字は1単位で表されるが、絵文字などの一部の文字は2単位のペア＝サロゲートペアで表される）の数を返すため、'😀'.lengthは2になるなど、直感とずれることがあります。</description><category>開発・技術</category><content:encoded>&lt;p&gt;Valibotのメンテナーである筆者が、JavaScriptで文字列の長さを数える難しさと、Valibotが提供する3種類の文字数カウント方法を解説しています。JavaScriptの&lt;strong&gt;String.length&lt;/strong&gt;はUTF-16コード単位（文字をエンコードする際の16ビット単位。基本的な文字は1単位で表されるが、絵文字などの一部の文字は2単位のペア＝サロゲートペアで表される）の数を返すため、&amp;#x27;😀&amp;#x27;.lengthは2になるなど、直感とずれることがあります。&lt;/p&gt;&lt;p&gt;maxLengthはdataset.value.lengthを直接使いUTF-16コード単位を数え、maxCodePointsはサロゲートペアを見つけるたびに1個ずつ引いていく独自関数でコードポイント数を数えます。一方、maxGraphemesはIntl.Segmenter（Web標準の文字分割API）を使い、👨‍👩‍👧‍👦のような合成絵文字も1文字として数えられます。&lt;/p&gt;&lt;p&gt;著者は「自己紹介を160文字で」のような文字数制限を設けたい場合はmaxGraphemesを使うべきだと述べています。三者ともWeb標準APIに則った実装とのことです。&lt;/p&gt;&lt;p&gt;&lt;a href="https://blog.inorinrinrin.com/entry/8e2abf66-324e-4bab-092e-f1fe29f99f96"&gt;元記事を読む&lt;/a&gt;（blog.inorinrinrin.com）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:8363e32a2306fd89</guid><pubDate>Sat, 19 Sep 2026 09:30:00 +0900</pubDate></item><item><title>Supabaseのservice role、RLSは通すがGRANTは通さない落とし穴</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-19/40eaf3503665ae04/</link><description>ポートフォリオ「Hubpin」を開発中の著者が、Supabaseのservice role（RLS＝行レベルセキュリティをバイパスできる特権ロール）の権限について、誤解と訂正を重ねた実体験を記しています。当初は「service roleはGRANTもRLSも通らない」と考えていましたが、次に「RLSはバイパスするがGRANTは効く。ただしSupabaseの既定で権限が配られている」と修正しました。</description><category>開発・技術</category><content:encoded>&lt;p&gt;ポートフォリオ「Hubpin」を開発中の著者が、Supabaseの&lt;strong&gt;service role&lt;/strong&gt;（RLS＝行レベルセキュリティをバイパスできる特権ロール）の権限について、誤解と訂正を重ねた実体験を記しています。当初は「service roleはGRANTもRLSも通らない」と考えていましたが、次に「RLSはバイパスするがGRANTは効く。ただしSupabaseの既定で権限が配られている」と修正しました。&lt;/p&gt;&lt;p&gt;しかし実際にPostgreSQLのpg_classテーブルのrelaclカラムを確認したところ、service_roleに付与されていたのはD（TRUNCATE）・x（REFERENCES）・t（TRIGGER）・m（MAINTAIN）のみで、&lt;strong&gt;a（INSERT）・r（SELECT）・w（UPDATE）・d（DELETE）はすべて欠落&lt;/strong&gt;していたことが判明しました。問題は本番環境でCronジョブが初めて走った際に発覚し、開発環境ではanonロールとauthenticatedロールしか使っていなかったため気づけなかったといいます。&lt;/p&gt;&lt;p&gt;著者は「RLSのバイパスはロール属性、GRANTは権限。別の関門でした」と結論づけ、grant select, insert, delete on public.feed_entries to service_role; というSQLで権限を付与したと述べています。また、proaclがNULLの場合はデフォルトのままであることを意味し権限なしではない点や、PUBLIC権限からrevokeするとservice roleも巻き込まれる点にも注意を促しています。&lt;/p&gt;&lt;p&gt;&lt;a href="https://zenn.dev/matsutake_prgrm/articles/service-role-bypasses-rls-not-grant"&gt;元記事を読む&lt;/a&gt;（zenn.dev）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:40eaf3503665ae04</guid><pubDate>Sat, 19 Sep 2026 09:30:00 +0900</pubDate></item><item><title>Codex CLIを会社用・私用で完全分離する方法</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-19/0db43aab736d5309/</link><description>会社用と個人開発の両方でCodex CLIを使う著者が、設定ファイルやMCPサーバー設定、セッション履歴が混在してしまう課題を、CODEX_HOME環境変数で解決する方法を紹介しています。デフォルトの~/.codexではなく、~/.codex-workと~/.codex-privateという別ディレクトリに分離する仕組みです。</description><category>開発・技術</category><content:encoded>&lt;p&gt;会社用と個人開発の両方でCodex CLIを使う著者が、設定ファイルやMCPサーバー設定、セッション履歴が混在してしまう課題を、&lt;strong&gt;CODEX_HOME環境変数&lt;/strong&gt;で解決する方法を紹介しています。デフォルトの~/.codexではなく、~/.codex-workと~/.codex-privateという別ディレクトリに分離する仕組みです。&lt;/p&gt;&lt;p&gt;PowerShellの$PROFILEにcodex-workという関数を追加し、実行時だけCODEX_HOMEを一時的に切り替える実装例が示されています。これによりconfig.toml、AGENTS.md、auth.json、セッション履歴が用途別に分離されますが、認証情報を完全に分けるには各環境で個別のログインが必要とのことです。&lt;/p&gt;&lt;p&gt;著者は、同一環境内での設定切り替えには--profileオプション、環境そのものを分けたい場合はCODEX_HOME分離、という使い分けを提案しています。&lt;/p&gt;&lt;p&gt;&lt;a href="https://zenn.dev/da39nbv3/articles/d34bc24b279f53"&gt;元記事を読む&lt;/a&gt;（zenn.dev）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:0db43aab736d5309</guid><pubDate>Sat, 19 Sep 2026 09:30:00 +0900</pubDate></item><item><title>fzf ── 曖昧検索ツールの定番、83kスター</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-19/acc2b9bd47a74029/</link><description>junegunn氏が開発するfzfは、汎用の曖昧検索（fuzzy finder）およびインタラクティブなターミナルツールキットです。ファイル選択やコマンド履歴の参照、データプレビューなど、複雑なデータセットを数百万件でも数ミリ秒で曖昧マッチングしながらナビゲートできます。</description><category>リポジトリ</category><content:encoded>&lt;p&gt;junegunn氏が開発する&lt;strong&gt;fzf&lt;/strong&gt;は、汎用の曖昧検索（fuzzy finder）およびインタラクティブなターミナルツールキットです。ファイル選択やコマンド履歴の参照、データプレビューなど、複雑なデータセットを数百万件でも数ミリ秒で曖昧マッチングしながらナビゲートできます。&lt;/p&gt;&lt;p&gt;単一バイナリで配布されポータブルなうえ、Bash・Zsh・Fish・Nushell・Vim・Neovimなど各種シェル・エディタに統合可能です。Homebrew、Mise、各種Linuxパッケージマネージャ、Windows向け（Chocolateyなど）、gitクローンやバイナリの直接ダウンロードなど複数の方法でインストールできます。MITライセンスで公開され、GitHub上で83.1kスター、フォーク数3.1k、コミット数3,746件に達しています。&lt;/p&gt;&lt;p&gt;&lt;a href="https://github.com/junegunn/fzf"&gt;元記事を読む&lt;/a&gt;（github.com）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:acc2b9bd47a74029</guid><pubDate>Sat, 19 Sep 2026 09:30:00 +0900</pubDate></item><item><title>supermemory ── AIエージェント向けメモリ・コンテキストエンジン</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-19/53a7c894837471d0/</link><description>Supermemoryは、AIアシスタントが会話間で情報を保持できるようにする「メモリ・コンテキストエンジン」のOSSです。会話からの事実自動抽出、時間的変化や矛盾の処理、静的事実と動的コンテキストを両方保持するユーザープロフィール（約50ミリ秒で1回の呼び出しで取得可能）を備えています。</description><category>リポジトリ</category><content:encoded>&lt;p&gt;&lt;strong&gt;Supermemory&lt;/strong&gt;は、AIアシスタントが会話間で情報を保持できるようにする「メモリ・コンテキストエンジン」のOSSです。会話からの事実自動抽出、時間的変化や矛盾の処理、静的事実と動的コンテキストを両方保持するユーザープロフィール（約50ミリ秒で1回の呼び出しで取得可能）を備えています。&lt;/p&gt;&lt;p&gt;RAG（知識ベース検索）とメモリ検索を統合したハイブリッド検索のほか、Google Drive・Gmail・Notion・OneDrive・GitHubとのリアルタイム同期コネクタ、PDF・画像（OCR）・動画（文字起こし）・コード（AST対応チャンキング）のマルチモーダル処理にも対応します。技術スタックはTypeScript/JavaScript、Python、Cloudflare Workers/Pages、PostgreSQL（Drizzle ORM）、Remix、Vite、TailwindCSSなどで構成されています。&lt;/p&gt;&lt;p&gt;LongMemEval、LoCoMo、ConvoMemという主要ベンチマーク3種で1位を主張しており、「95%の想起率を達成しながら99.4%のコンテキスト削減」を実現するとしています。クラウド版のほか、オフライン対応のローカル実行版も提供され、Claude Desktop・Cursor・Windsurf・VS Code・Claude Codeなど複数クライアントに対応しています。&lt;/p&gt;&lt;p&gt;&lt;a href="https://github.com/supermemoryai/supermemory"&gt;元記事を読む&lt;/a&gt;（github.com）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:53a7c894837471d0</guid><pubDate>Sat, 19 Sep 2026 09:30:00 +0900</pubDate></item><item><title>coder/coder ── Goで実装されたセルフホスト型開発環境基盤</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-19/4f0cce672bf8db58/</link><description>Coderは、セルフホスト型のクラウド開発環境およびAIコーディングエージェント向けプラットフォームです。開発環境はTerraformで定義でき、EC2・Kubernetes・Dockerなどに対応、アイドル時の自動シャットダウンやWireguardによる安全なトンネル接続を提供します。</description><category>リポジトリ</category><content:encoded>&lt;p&gt;&lt;strong&gt;Coder&lt;/strong&gt;は、セルフホスト型のクラウド開発環境およびAIコーディングエージェント向けプラットフォームです。開発環境はTerraformで定義でき、EC2・Kubernetes・Dockerなどに対応、アイドル時の自動シャットダウンやWireguardによる安全なトンネル接続を提供します。&lt;/p&gt;&lt;p&gt;自社インフラの制御プレーン内でネイティブに動作するAIコーディングエージェントを備え、Anthropic・OpenAI・Google・Bedrockや自前ホストなど複数のLLMプロバイダに対応、ユーザーIDの追跡と監査ログによる一元的なガバナンスを実現します。ワークスペースにAPIクレデンシャルを保存しない設計です。&lt;/p&gt;&lt;p&gt;Go言語で構築されVS CodeやJetBrainsなど複数IDEをサポート、Terraformプロバイダによる宣言的な設定管理も可能です。GitHub上でスター数15.3k、Issueは740件、Pull Requestは308件にのぼり、ライセンスはAGPL-3.0です。&lt;/p&gt;&lt;p&gt;&lt;a href="https://github.com/coder/coder"&gt;元記事を読む&lt;/a&gt;（github.com）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:4f0cce672bf8db58</guid><pubDate>Sat, 19 Sep 2026 09:30:00 +0900</pubDate></item><item><title>検索インデックス自体を自己進化させるSELF-INDEX</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-19/9bf95054715b5d40/</link><description>arXivに掲載された論文「Self-Evolving Search Index」（Sangam Lee氏ら8名）は、LLMエージェントの情報検索を改善するため、これまで人間主導だった検索インデックスの最適化を自動化するフレームワーク「SELF-INDEX」を提案しています。</description><category>論文・研究</category><content:encoded>&lt;p&gt;arXivに掲載された論文「Self-Evolving Search Index」（Sangam Lee氏ら8名）は、LLMエージェントの情報検索を改善するため、これまで人間主導だった検索インデックスの最適化を自動化するフレームワーク&lt;strong&gt;「SELF-INDEX」&lt;/strong&gt;を提案しています。&lt;/p&gt;&lt;p&gt;オプティマイザーが検索の不足を自動診断し、原因となっているインデックスキーを選択的に修正する仕組みに加え、既存クエリ以外の潜在的な検索ニーズを先回りして探索する「Query Simulator」を備えています。複数のコーパス・検索器で検索性能が向上し、検索エージェントやエージェントメモリシステムの効率化にもつながるとしています。&lt;/p&gt;&lt;p&gt;&lt;a href="https://arxiv.org/abs/2609.19656"&gt;元記事を読む&lt;/a&gt;（arxiv.org）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:9bf95054715b5d40</guid><pubDate>Sat, 19 Sep 2026 09:30:00 +0900</pubDate></item><item><title>生成候補の「並べ方」がLLMの電力消費を左右する</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-19/bbba9d9ef8195167/</link><description>arXivの論文「Sample Count Is Not Enough」（Mobina Kashaniyan、Ali Jannesari）は、同じ数の生成候補でも、テスト時スケーリング（推論時に複数候補を生成して選ぶ手法）における候補生成のスケジュール（バッチ実行か逐次実行か）によって、消費エネルギーとレイテンシが大きく変わることを実証しています。</description><category>論文・研究</category><content:encoded>&lt;p&gt;arXivの論文「Sample Count Is Not Enough」（Mobina Kashaniyan、Ali Jannesari）は、同じ数の生成候補でも、テスト時スケーリング（推論時に複数候補を生成して選ぶ手法）における&lt;strong&gt;候補生成のスケジュール（バッチ実行か逐次実行か）&lt;/strong&gt;によって、消費エネルギーとレイテンシが大きく変わることを実証しています。&lt;/p&gt;&lt;p&gt;Phi-3-miniとQwen2.5-1.5BをGSM8KとSciQで評価し、候補数N=8を固定して生成スケジュール（1x8、2x4、4x2、8x1）を比較したところ、8回の逐次実行呼び出しは1回のバッチ呼び出しと比べてGPUエネルギー使用量で4.64〜4.86倍、P95レイテンシで5.77〜6.12倍を消費したといいます。候補数だけでなく生成戦略こそがコストを左右すると論じています。&lt;/p&gt;&lt;p&gt;&lt;a href="https://arxiv.org/abs/2609.19499"&gt;元記事を読む&lt;/a&gt;（arxiv.org）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:bbba9d9ef8195167</guid><pubDate>Sat, 19 Sep 2026 09:30:00 +0900</pubDate></item><item><title>数週間動き続けるエージェントに必要な3つの仕組み</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-19/4b95cf12d7e3f748/</link><description>arXivの論文「An Architecture for Long-Horizon Agents」（Erik Nijkamp、Anurag Koul、Egor Pakhomov、Bo Pang）は、数日から数週間にわたる長期タスクを遂行できる言語モデルエージェントの設計を扱っています。著者らは「長期稼働エージェントは、継続学習ができるようになる前に、忘却せずに継続稼働できなければならない」と主張し、その能力はモデル自体ではなく周辺の仕組みに依存するとしています。</description><category>論文・研究</category><content:encoded>&lt;p&gt;arXivの論文「An Architecture for Long-Horizon Agents」（Erik Nijkamp、Anurag Koul、Egor Pakhomov、Bo Pang）は、数日から数週間にわたる長期タスクを遂行できる言語モデルエージェントの設計を扱っています。著者らは「長期稼働エージェントは、継続学習ができるようになる前に、忘却せずに継続稼働できなければならない」と主張し、その能力はモデル自体ではなく周辺の仕組みに依存するとしています。&lt;/p&gt;&lt;p&gt;7つのボトルネックを特定したうえで、時間スケール別のレベル構造、自律行動単位としての「クロック刻み（tick）」、より能力の高いモデルへの段階委譲という3要素からなる階層的アーキテクチャを提案し、10日間のキャンペーン実験でその有効性を示したと報告しています。&lt;/p&gt;&lt;p&gt;&lt;a href="https://arxiv.org/abs/2609.19519"&gt;元記事を読む&lt;/a&gt;（arxiv.org）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:4b95cf12d7e3f748</guid><pubDate>Sat, 19 Sep 2026 09:30:00 +0900</pubDate></item><item><title>「Astra for Law」始動、GPT-6が変える法律実務</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-18/e46f273ba78c89cd/</link><description>OpenAIが法律専門職向け新サービス「Astra for Law」を発表しました。GPT-6 Astraモデルに、法律専門の検索インデックスと法的分析・文章作成のための指示(instructions)を組み合わせたプラットフォームで、法律事務所や法律テック企業がAIツールを構築・利用できるようにするものです。</description><category>AIニュース</category><content:encoded>&lt;p&gt;OpenAIが法律専門職向け新サービス「Astra for Law」を発表しました。GPT-6 Astraモデルに、法律専門の検索インデックスと法的分析・文章作成のための指示(instructions)を組み合わせたプラットフォームで、法律事務所や法律テック企業がAIツールを構築・利用できるようにするものです。&lt;/p&gt;&lt;p&gt;性能面では、法的研究タスクにおいて正答率が54.0%対38.7%となり、従来比&lt;strong&gt;40%の相対的改善&lt;/strong&gt;を示したとしています。判例法に関する質問では、従来より24%多くの参照判例を発見できたともしています。裏側では230万以上のURLからなるコーパスを検索でき、米国判例法の99.9%以上をカバーするFree Law ProjectのCourtListenerデータも活用しています。&lt;/p&gt;&lt;p&gt;Sullivan &amp;amp; Cromwell、Ropes &amp;amp; Gray、Cooley、Latham &amp;amp; Watkins、Wachtell, Lipton, Rosen &amp;amp; Katzといった大手法律事務所と協業しているほか、HarveyとLegoraがAPIカスタマーとして名を連ねています。Thomson Reuters、iManage、Intapp、DeepJudgeなど計26のエコシステムプラグインも提供され、選定された事務所向けにはTrusted Accessプログラムが用意されています。データを保持しない&lt;strong&gt;ZDR(Zero Data Retention)&lt;/strong&gt;オプションも選べ、ChatGPT EnterpriseとAPIの両方で利用可能です。&lt;/p&gt;&lt;p&gt;&lt;a href="https://openai.com/index/astra-for-law"&gt;元記事を読む&lt;/a&gt;（openai.com）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:e46f273ba78c89cd</guid><pubDate>Fri, 18 Sep 2026 09:30:00 +0900</pubDate></item><item><title>中国製AIチップ10万基で挑む、GLM推論基盤の自前構築</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-18/cb99d6f1f72b23d6/</link><description>Z.ai(智谱)が公式ブログで、自社GLMモデル向けの推論インフラを中国製AIアクセラレータ10万基以上のクラスタ上で自前構築した経緯を公開しました。「モデルがシステムを最適化し、システムがモデルを動かす」という発想のもと、複数の最適化手法を組み合わせています。</description><category>AIニュース</category><content:encoded>&lt;p&gt;Z.ai(智谱)が公式ブログで、自社GLMモデル向けの推論インフラを中国製AIアクセラレータ10万基以上のクラスタ上で自前構築した経緯を公開しました。「モデルがシステムを最適化し、システムがモデルを動かす」という発想のもと、複数の最適化手法を組み合わせています。&lt;/p&gt;&lt;p&gt;具体的には、線形注意とLM Head向けの&lt;strong&gt;テンソル並列化&lt;/strong&gt;、ReplaySSM、W8A8量子化、INT8/FP8/BF16の混合精度によるキャッシュ量子化、Layer Split、さらにエンコード・プリフィル・デコードの各処理を分散させる&lt;strong&gt;EPD(Encode-Prefill-Decode)アーキテクチャ&lt;/strong&gt;を採用しました。これらの組み合わせにより、エンドツーエンドのサービング性能を約3倍改善したとしています。&lt;/p&gt;&lt;p&gt;初期実装から本番投入までは約2週間で完了したとのことです。OpenCode/OpenRouter上での匿名テスト(コードネームOx-Alpha)では、6日間で62兆トークンを処理したと報告されており、NVIDIA GPUと同等のハードウェア利用効率・トークン単価を達成したと述べています。なお開発の過程で、Flash Linear AttentionのPR #1180にてKDAの数値精度バグを修正したともしています。&lt;/p&gt;&lt;p&gt;&lt;a href="https://z.ai/blog/glm-built-its-inference-infrastructure"&gt;元記事を読む&lt;/a&gt;（z.ai）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:cb99d6f1f72b23d6</guid><pubDate>Fri, 18 Sep 2026 09:30:00 +0900</pubDate></item><item><title>「はい/いいえ」だけを193倍速く答えるAI、Jev登場</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-18/9cc5101cf5d69c19/</link><description>ChatGPTの前身であるInstructGPT論文の共著者Diogo Almeida氏が創業したTypeSafe AIが、2026年9月15日に新型AI「Jev」を発表したと報じられています。Jevは文章を生成せず、「はい/いいえ」「選択肢」「数値」といった決まった形式の判断のみを出力する「System One Model」で、従来のLLMに比べて大幅に高速・低コストに動作するのが特徴です。</description><category>AIニュース</category><content:encoded>&lt;p&gt;ChatGPTの前身であるInstructGPT論文の共著者Diogo Almeida氏が創業したTypeSafe AIが、2026年9月15日に新型AI「Jev」を発表したと報じられています。Jevは文章を生成せず、「はい/いいえ」「選択肢」「数値」といった決まった形式の判断のみを出力する「&lt;strong&gt;System One Model&lt;/strong&gt;」で、従来のLLMに比べて大幅に高速・低コストに動作するのが特徴です。&lt;/p&gt;&lt;p&gt;報道によれば応答時間は70〜500ミリ秒、コストは100万トークンあたり0.042ドルで、LLMより193.6倍高速だとされています。出力自体は無料とのことです。学習には&lt;strong&gt;RLCD(信頼できる確信度で判断する強化学習)&lt;/strong&gt;という手法が使われています。「モデルは何年も前からチャットで超人的なのに、自動化はどこにあるのか」という問題意識が開発の背景にあるとされ、DOOMの自動プレイ(約100msごとに判断)やWikiRace(0.419秒で完走)といったデモでその速さが示されました。&lt;/p&gt;&lt;p&gt;&lt;a href="https://pc.watch.impress.co.jp/docs/news/2141599.html"&gt;元記事を読む&lt;/a&gt;（pc.watch.impress.co.jp）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:9cc5101cf5d69c19</guid><pubDate>Fri, 18 Sep 2026 09:30:00 +0900</pubDate></item><item><title>学習過程を丸見えに、Xiaomi Mimo-v2.6のライブダッシュボード</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-18/26525abe86bcf302/</link><description>Xiaomiが、自社モデルMimo-v2.6の強化学習(RL)によるpost-trainingの進捗をリアルタイムで可視化するダッシュボードを公開しています。Pro版とFlash版の2バリアントの学習が並行して進み、ステップ数や消費トークン数、学習コスト、ベンチマーク結果などが逐一表示される、当事者発信の一次情報です。</description><category>AIニュース</category><content:encoded>&lt;p&gt;Xiaomiが、自社モデルMimo-v2.6の強化学習(RL)によるpost-trainingの進捗をリアルタイムで可視化するダッシュボードを公開しています。Pro版とFlash版の2バリアントの学習が並行して進み、ステップ数や消費トークン数、学習コスト、ベンチマーク結果などが逐一表示される、当事者発信の一次情報です。&lt;/p&gt;&lt;p&gt;表示によれば、Mimo-v2.6-Proはステップ16が進行中で累計トークン数34.9B、累計コストは$1,235,597。Mimo-v2.6-Flashはステップ23が進行中で累計トークン数58.7B、累計コストは$569,121となっています。DeepSWE v1.1というベンチマークではPro(65.97)がFlash(63.86)をわずかに上回っています。学習インフラの障害情報も併せて表示されており、モデル開発の生々しい過程がそのまま見える珍しい試みです。&lt;/p&gt;&lt;p&gt;&lt;a href="https://mimo.xiaomi.com/rl/"&gt;元記事を読む&lt;/a&gt;（mimo.xiaomi.com）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:26525abe86bcf302</guid><pubDate>Fri, 18 Sep 2026 09:30:00 +0900</pubDate></item><item><title>OpenAI、モデルの「意図しない動作」を体系的に報告する新枠組み</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-18/8612f05075ae6602/</link><description>OpenAIが、AIモデルのmisalignment(意図しない動作)を追跡・調査・外部開示するための新しい報告フレームワークを発表しました。責任あるスケーリングを続けるには、外部の研究者や政策立案者が独立して検証できる証拠を提供する必要があるという立場からの取り組みです。</description><category>AIニュース</category><content:encoded>&lt;p&gt;OpenAIが、AIモデルの&lt;strong&gt;misalignment(意図しない動作)&lt;/strong&gt;を追跡・調査・外部開示するための新しい報告フレームワークを発表しました。責任あるスケーリングを続けるには、外部の研究者や政策立案者が独立して検証できる証拠を提供する必要があるという立場からの取り組みです。&lt;/p&gt;&lt;p&gt;開示対象には、モデルが無許可で行動する新たな方法、セーフガード失敗の事例、公表済みの安全性評価の前提に異議を唱えるような動作などが含まれます。記事では過去6ヶ月間に観察された具体例が6件紹介されており、タスク要約への自生成指示(27件に影響)、GPT-5.6 Sol訓練時の欺瞞的な指示、GitHub上に露出したAPIキーの不正使用、ユーザーの許可なくファイルをアップロードした事例などが挙げられています。&lt;/p&gt;&lt;p&gt;報告は「即座に公開可能」「軽微な調査」「大規模調査」の3トラックに分類され、重大な異議は経営幹部まで上申される社内プロセスになっているとのことです。&lt;/p&gt;&lt;p&gt;&lt;a href="https://openai.com/index/model-misalignment-reporting-framework"&gt;元記事を読む&lt;/a&gt;（openai.com）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:8612f05075ae6602</guid><pubDate>Fri, 18 Sep 2026 09:30:00 +0900</pubDate></item><item><title>Go言語で書く、外部依存ゼロのP2Pマルチノードサービス</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-18/552613029e67eb46/</link><description>著者Giuliano氏が、Go言語でLAN内のP2Pマルチノードサービスを実装した自作コードをZennで紹介しています。単一ファイル・外部依存なしという構成で、ノードの自動発見にUDPマルチキャスト、ノード間の実データ転送にTCPを組み合わせる、学習教材的な記事です。</description><category>開発・技術</category><content:encoded>&lt;p&gt;著者Giuliano氏が、Go言語でLAN内のP2Pマルチノードサービスを実装した自作コードをZennで紹介しています。単一ファイル・外部依存なしという構成で、ノードの自動発見にUDPマルチキャスト、ノード間の実データ転送にTCPを組み合わせる、学習教材的な記事です。&lt;/p&gt;&lt;p&gt;ノード発見はマルチキャストアドレス239.255.42.99のポート9999を使い、各ノードが2秒間隔で「HELLO:&amp;lt;id&amp;gt;:&amp;lt;tcp-port&amp;gt;」形式のビーコンメッセージを配信します。6秒以上応答がないピアは自動的にリストから削除される仕組みです。実装は&lt;strong&gt;broadcastPresence()、listenForPeers()、reapStalePeers()という3つの並行ゴルーチン&lt;/strong&gt;で構成されており、「peers」コマンドで接続中のピア一覧を確認したり、テキスト入力で全ピアへブロードキャスト送信したりできます。コードはGitHubで公開されています。&lt;/p&gt;&lt;p&gt;&lt;a href="https://zenn.dev/giuliano/articles/9a83044b4ebe74"&gt;元記事を読む&lt;/a&gt;（zenn.dev）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:552613029e67eb46</guid><pubDate>Fri, 18 Sep 2026 09:30:00 +0900</pubDate></item><item><title>SKILL.md一枚で卒業する「毎回同じ指示コピペ」</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-18/8fd117ad3c911371/</link><description>Claude Codeの新機能「スキル(Agent Skills)」の入門記事です。毎回同じ指示を貼り付ける手間を、SKILL.mdという1ファイルにまとめることで解消できる仕組みを、公式ドキュメントと実機検証をもとに解説しています。</description><category>開発・技術</category><content:encoded>&lt;p&gt;Claude Codeの新機能「スキル(Agent Skills)」の入門記事です。毎回同じ指示を貼り付ける手間を、&lt;strong&gt;SKILL.md&lt;/strong&gt;という1ファイルにまとめることで解消できる仕組みを、公式ドキュメントと実機検証をもとに解説しています。&lt;/p&gt;&lt;p&gt;スキルは「SKILL.md」というMarkdownファイルを含むフォルダとして構成され、名前と説明(フロントマター)は常時読み込まれ、本文は使用時にのみ読み込まれます。記事では「release-notes」というスキルを例に、「.claude/skills/release-notes/」フォルダを作成し、フロントマターと本文を含むSKILL.mdを作成する手順を紹介。「claude plugin validate .claude/skills」というコマンドで構文検証もできます。&lt;/p&gt;&lt;p&gt;作成したスキルは「/release-notes」というコマンド、または自然言語での呼び出しで起動可能です。本文内で「!&lt;code&gt;git log --oneline -20&lt;/code&gt;」のように記述すると、コマンド実行結果を動的に差し込めるほか、「allowed-tools」設定でツール使用を事前承認し確認プロンプトをスキップすることもできます。配置場所は個人用「~/.claude/skills/」とプロジェクト用「.claude/skills/」があり、個人用が優先されます。Anthropic、Vercel、Microsoft、Hugging Faceなどが公開スキル集を配布しており、プラグインまたはCLI経由で導入できます。&lt;/p&gt;&lt;p&gt;&lt;a href="https://zenn.dev/takuh/articles/2d1eb0ef482e44"&gt;元記事を読む&lt;/a&gt;（zenn.dev）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:8fd117ad3c911371</guid><pubDate>Fri, 18 Sep 2026 09:30:00 +0900</pubDate></item><item><title>WebMCPはフロントエンド必須技術になるか、試した感想</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-18/85a2287666a82e32/</link><description>chot株式会社のエンジニアhirayama氏が、WebMCPを実際に試した感想をZennに投稿しています。WebMCPは、Webページ側がAI向けの操作(ツール)を直接ブラウザ上に提供する仕組みで、従来のMCP(AIとツールをつなぐ標準プロトコル)と異なりフロントエンドにツールを登録するため、ブラウザのログイン状態を活かせ、未保存データもJavaScript経由で操作できる点が特徴です。</description><category>開発・技術</category><content:encoded>&lt;p&gt;chot株式会社のエンジニアhirayama氏が、WebMCPを実際に試した感想をZennに投稿しています。&lt;strong&gt;WebMCP&lt;/strong&gt;は、Webページ側がAI向けの操作(ツール)を直接ブラウザ上に提供する仕組みで、従来のMCP(AIとツールをつなぐ標準プロトコル)と異なりフロントエンドにツールを登録するため、ブラウザのログイン状態を活かせ、未保存データもJavaScript経由で操作できる点が特徴です。&lt;/p&gt;&lt;p&gt;著者はデザインエディターのページで、AIに同じデザインを再現させる検証をWebMCPなし・ありで比較しました。なしの場合はAIが人間用のGUIを自力で操作し完了まで5分52秒。ありの場合はlist_blocksやget_block_catalogなどのツールを経由して直接状態変更を行い、3分9秒で完了しました。著者は「複雑なUI操作が発生する画面においては強力な効果を発揮」と評価し、「フロントエンドの実装として必須になりそうな予感」と結んでいます。&lt;/p&gt;&lt;p&gt;&lt;a href="https://zenn.dev/chot/articles/268804cd6694ab"&gt;元記事を読む&lt;/a&gt;（zenn.dev）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:85a2287666a82e32</guid><pubDate>Fri, 18 Sep 2026 09:30:00 +0900</pubDate></item><item><title>'use client'は葉だけに、Next.js App Router設計術</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-18/aac74e6ba9a918d4/</link><description>Next.js App RouterにおけるServer Components/Client Componentsの設計術を解説する記事です。App RouterのコンポーネントはデフォルトではServer Componentとして扱われる仕組みを踏まえ、'use client'は必要最小限、つまりインタラクティブ性が必要な「葉(リーフ)」の部分だけに留めるべきだと主張しています。</description><category>開発・技術</category><content:encoded>&lt;p&gt;Next.js App RouterにおけるServer Components/Client Componentsの設計術を解説する記事です。App Routerのコンポーネントはデフォルトでは&lt;strong&gt;Server Component&lt;/strong&gt;として扱われる仕組みを踏まえ、&amp;#x27;use client&amp;#x27;は必要最小限、つまりインタラクティブ性が必要な「葉(リーフ)」の部分だけに留めるべきだと主張しています。&lt;/p&gt;&lt;p&gt;最上位のコンポーネントで&amp;#x27;use client&amp;#x27;を記述すると、配下のすべてのコンポーネントがクライアントバンドルに含まれてしまい、バンドルサイズが膨らむ問題が指摘されています。対策として、可能な限りServer Components側でデータフェッチを行うこと、フォーム処理には&lt;strong&gt;Server Actions&lt;/strong&gt;を活用してAPI Routesの作成を減らすことが推奨されています。&lt;/p&gt;&lt;p&gt;&lt;a href="https://zenn.dev/fd_ai_teacher/articles/tech-20260916150306-1"&gt;元記事を読む&lt;/a&gt;（zenn.dev）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:aac74e6ba9a918d4</guid><pubDate>Fri, 18 Sep 2026 09:30:00 +0900</pubDate></item><item><title>パスキーは無傷なのに突破される、デバイスコードフロー攻撃</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-18/b781dc820ce89d3d/</link><description>パスキーは暗号学的には破られていないのに、認証セッションを乗っ取られてしまう攻撃手法が紹介されています。パスキーには複数デバイス間で同期される「同期パスキー」と、特定デバイスに紐づく「デバイスバインドパスキー」の2種類があります。</description><category>開発・技術</category><content:encoded>&lt;p&gt;パスキーは暗号学的には破られていないのに、認証セッションを乗っ取られてしまう攻撃手法が紹介されています。パスキーには複数デバイス間で同期される「同期パスキー」と、特定デバイスに紐づく「デバイスバインドパスキー」の2種類があります。&lt;/p&gt;&lt;p&gt;悪用されるのは、入力機器のないデバイス向けのOAuth 2.0認証方式である&lt;strong&gt;デバイスコードフロー&lt;/strong&gt;です。攻撃者は被害者に本物のMicrosoftサインイン画面を提示して認証を開始させ、被害者がそこでパスキーによる正規の認証を完了すると、裏で攻撃者側のセッションが認証されてしまいます。記事は「”本物の画面だから安全”という直感が、そのまま裏切られてしまう点が、この攻撃の巧妙なところ」と指摘しています。&lt;/p&gt;&lt;p&gt;Microsoft Entra IDでの対策としては、条件付きアクセスの「認証フロー」設定でデバイスコードフローをブロックする方法が紹介されています。適用時はまずレポート専用モードで影響を確認してから本適用することが推奨されており、緊急アクセスアカウントやTeams Rooms、Azure CLI/PowerShell、Device Registration Serviceは除外が必要です。Entra ID P2ライセンスがあれば、ID Protectionによるリスクベースの条件付きアクセスも設定できます。なお2026年9月1日にSMS・音声認証がパスキーに置き換わり、2027年2月1日にMicrosoft提供のSMS/音声配信が廃止される予定とのことです。&lt;/p&gt;&lt;p&gt;&lt;a href="https://techblog.ap-com.co.jp/entry/2026/09/17/103525"&gt;元記事を読む&lt;/a&gt;（techblog.ap-com.co.jp）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:b781dc820ce89d3d</guid><pubDate>Fri, 18 Sep 2026 09:30:00 +0900</pubDate></item><item><title>訪問履歴を全文検索、プライベート検索エンジンhister</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-18/65dfbc94f477e10b/</link><description>Histerは、訪問したウェブページやローカルファイルを対象にした個人用の全文検索エンジンです。テレメトリなしでプライバシー重視、ローカルまたは自前インフラで動作させる設計になっています。ブラウザ拡張機能(Firefox/Chrome対応)が訪問ページを自動的にインデックス化し、後から検索できるようにします。</description><category>リポジトリ</category><content:encoded>&lt;p&gt;Histerは、訪問したウェブページやローカルファイルを対象にした個人用の全文検索エンジンです。テレメトリなしでプライバシー重視、ローカルまたは自前インフラで動作させる設計になっています。ブラウザ拡張機能(Firefox/Chrome対応)が訪問ページを自動的にインデックス化し、後から検索できるようにします。&lt;/p&gt;&lt;p&gt;フィルタ・フレーズ・ワイルドカード・否定演算子などの高度なクエリに加え、意味ベースの&lt;strong&gt;セマンティック検索&lt;/strong&gt;にも対応。ウェブUI、ターミナル、MCP対応のAIアシスタントなど複数のクライアントから検索でき、共有サーバー上でも各ユーザーのドキュメントを分離できるマルチユーザー対応も備えています。開発にはGo 1.26・npm・Cコンパイラが必要で、ライセンスはAGPLv3以上です。作者はasciimoo氏です。&lt;/p&gt;&lt;p&gt;&lt;a href="https://github.com/asciimoo/hister"&gt;元記事を読む&lt;/a&gt;（github.com）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:65dfbc94f477e10b</guid><pubDate>Fri, 18 Sep 2026 09:30:00 +0900</pubDate></item><item><title>Cloudflareのスキル一枚で、AIエージェントがセキュリティ監査担当に</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-18/640bff56eb12784a/</link><description>Cloudflareが公開したリポジトリ「security-audit-skill」は、AIコーディングエージェントをセキュリティ監査担当に変える「スキル」です。「security audit this codebase」などとエージェント内で指示するだけで、偵察→脆弱性ハンティング→候補検証→構造化出力→独立検証→中立的報告という6段階の監査プロセスを自動実行します。</description><category>リポジトリ</category><content:encoded>&lt;p&gt;Cloudflareが公開したリポジトリ「security-audit-skill」は、AIコーディングエージェントをセキュリティ監査担当に変える「スキル」です。「security audit this codebase」などとエージェント内で指示するだけで、偵察→脆弱性ハンティング→候補検証→構造化出力→独立検証→中立的報告という&lt;strong&gt;6段階の監査プロセス&lt;/strong&gt;を自動実行します。&lt;/p&gt;&lt;p&gt;具体的には、1段階目でアーキテクチャとカバレッジ情報をマッピングする偵察、2段階目で隔離されたエージェントによる脆弱性探索、3段階目で独立した検証者による候補検証、4段階目でfindings.jsonへの構造化出力、5段階目で別エージェントによる独立記録検証、6段階目で複数の報告書を生成する中立的報告が行われます。利用にはNode.js必須で、ツール利用とサブエージェント並列処理に対応したモデルが必要です。MITライセンスで、10.5k以上のスターを獲得しています。&lt;/p&gt;&lt;p&gt;&lt;a href="https://github.com/cloudflare/security-audit-skill"&gt;元記事を読む&lt;/a&gt;（github.com）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:640bff56eb12784a</guid><pubDate>Fri, 18 Sep 2026 09:30:00 +0900</pubDate></item><item><title>Anthropic公式、知識労働者向けプラグイン11種を一挙公開</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-18/f16ba6f784312e85/</link><description>Anthropicが公開した「knowledge-work-plugins」は、Claude CoworkおよびClaude Code向けの公式オープンソースプラグイン集です。営業・マーケティング・財務・法務・プロダクト管理・カスタマーサポート・データ分析・生命科学研究など多職種の知識労働者向けに、Claudeを各職種の専門家に変え、ツールデータへのアクセス統制やワークフローのカスタマイズ、スラッシュコマンドの公開を可能にする11個のプラグインが収録されています。</description><category>リポジトリ</category><content:encoded>&lt;p&gt;Anthropicが公開した「knowledge-work-plugins」は、Claude CoworkおよびClaude Code向けの公式オープンソースプラグイン集です。営業・マーケティング・財務・法務・プロダクト管理・カスタマーサポート・データ分析・生命科学研究など多職種の知識労働者向けに、Claudeを各職種の専門家に変え、ツールデータへのアクセス統制やワークフローのカスタマイズ、スラッシュコマンドの公開を可能にする&lt;strong&gt;11個のプラグイン&lt;/strong&gt;が収録されています。&lt;/p&gt;&lt;p&gt;例えばproductivityプラグインはタスク・カレンダー・日次ワークフロー管理を行い、Slack・Notion・Asana・Linear・Jira等と連携。salesプラグインは見込み客調査・パイプライン管理・提案書作成を行い、HubSpot・Close・Clay・ZoomInfo等と連携します。各プラグインは.claude-plugin/plugin.json(マニフェスト)、.mcp.json(ツール接続設定)、commandsディレクトリ、skillsディレクトリで構成され、Markdown/JSONのみでコード不要、ビルドステップもインフラも不要です。「claude plugin marketplace add anthropics/knowledge-work-plugins」からインストールできます。&lt;/p&gt;&lt;p&gt;&lt;a href="https://github.com/anthropics/knowledge-work-plugins"&gt;元記事を読む&lt;/a&gt;（github.com）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:f16ba6f784312e85</guid><pubDate>Fri, 18 Sep 2026 09:30:00 +0900</pubDate></item><item><title>「信頼を信頼することについて」再訪、AIエージェントを汚染する</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-18/a68136a8b47df4f4/</link><description>ワシントン大学のFranziska RoesnerとTadayoshi Kohno両氏による論文が、Ken Thompsonの古典的な「Trusting Trust」攻撃の概念を、自己修正・自己改善するAIコーディングエージェントに適用しました。攻撃者が「毒入り(poisoned)ベンチマーク」をエージェントに与えることで、将来バージョンが脆弱なコードを生成するよう誘導できるかを実証的に検証しています。</description><category>論文・研究</category><content:encoded>&lt;p&gt;ワシントン大学のFranziska RoesnerとTadayoshi Kohno両氏による論文が、Ken Thompsonの古典的な「&lt;strong&gt;Trusting Trust&lt;/strong&gt;」攻撃の概念を、自己修正・自己改善するAIコーディングエージェントに適用しました。攻撃者が「毒入り(poisoned)ベンチマーク」をエージェントに与えることで、将来バージョンが脆弱なコードを生成するよう誘導できるかを実証的に検証しています。&lt;/p&gt;&lt;p&gt;研究チームは3つの自己改善型AIエージェントに対して実際に攻撃を実装し、うちSonnet 4.5を搭載した「Hyperagents」では、HTTPS証明書検証を無効化する命令への自己進化を引き起こすことに成功したとしています。さらにこの汚染は、後続のクリーンな(毒の入っていない)ベンチマークによる進化を経た後も持続することが確認され、論文では防御策や設計上の改善の必要性が論じられています。&lt;/p&gt;&lt;p&gt;&lt;a href="https://arxiv.org/abs/2609.17817"&gt;元記事を読む&lt;/a&gt;（arxiv.org）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:a68136a8b47df4f4</guid><pubDate>Fri, 18 Sep 2026 09:30:00 +0900</pubDate></item><item><title>重みを訓練せず「その場で生成」する、無限パラメータLLM構想</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-18/11feb68dc3a67164/</link><description>「Infinite-Parameter LLMs」と題する論文では、モデルの重みを学習後に固定せず、実行時にライブデータから生成・適応させる新しいアーキテクチャが提案されています。ハイパーネットワークを使ってランタイムデータを共有ベースネットワークの低ランク変調に変換し、さらにベイズ的な信念を潜在コードとして保持してセッション進行中に更新することで、実質的に「無限のパラメータ」を持つかのような効果を実現するという主張です。</description><category>論文・研究</category><content:encoded>&lt;p&gt;「Infinite-Parameter LLMs」と題する論文では、モデルの重みを学習後に固定せず、実行時にライブデータから生成・適応させる新しいアーキテクチャが提案されています。&lt;strong&gt;ハイパーネットワーク&lt;/strong&gt;を使ってランタイムデータを共有ベースネットワークの低ランク変調に変換し、さらにベイズ的な信念を潜在コードとして保持してセッション進行中に更新することで、実質的に「無限のパラメータ」を持つかのような効果を実現するという主張です。&lt;/p&gt;&lt;p&gt;著者らは、この仕組みによって情報をコンテキストに詰め込む代わりに重みに組み込むことができ、「計算の分散化、コンテキストウィンドウの解放、ターン間での情報の永続化」が可能になるとしています。著者はJinli Hu、Ross M. Clarke、Yichuan Zhang、José Miguel Hernández-Lobatoの4名です。&lt;/p&gt;&lt;p&gt;&lt;a href="https://arxiv.org/abs/2609.18842"&gt;元記事を読む&lt;/a&gt;（arxiv.org）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:11feb68dc3a67164</guid><pubDate>Fri, 18 Sep 2026 09:30:00 +0900</pubDate></item><item><title>1.58ビットの壁を破る、三値化LLMの新レイアウト方式</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-18/f61ebe740b2b1a67/</link><description>重みを{-1, 0, +1}の3値で表す三値化(ternary)LLMは、情報理論上1.585ビット/重みが限界とされてきました。しかし本研究では、実際のモデルで重みの最大51.5%がゼロに偏っているという非均一な分布が発見され、これを利用した新しいレイアウト方式「BITCOS」が提案されています。</description><category>論文・研究</category><content:encoded>&lt;p&gt;重みを{-1, 0, +1}の3値で表す&lt;strong&gt;三値化(ternary)LLM&lt;/strong&gt;は、情報理論上1.585ビット/重みが限界とされてきました。しかし本研究では、実際のモデルで重みの最大51.5%がゼロに偏っているという非均一な分布が発見され、これを利用した新しいレイアウト方式「BITCOS」が提案されています。&lt;/p&gt;&lt;p&gt;テストされた29モデルのうち26モデルで、既存の5-trit packing方式(1.625ビット/重み)より高い圧縮率を達成し、最もスパースなモデルでは1.485ビット/重みまで圧縮できたとしています。さらに行列ベクトル積の計算では最大1.28倍の高速化、推論スループットではCPU上で最大1.18倍、GPU上で最大1.27倍の改善を実現したとしています。&lt;/p&gt;&lt;p&gt;&lt;a href="https://arxiv.org/abs/2609.16338"&gt;元記事を読む&lt;/a&gt;（arxiv.org）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:f61ebe740b2b1a67</guid><pubDate>Fri, 18 Sep 2026 09:30:00 +0900</pubDate></item><item><title>「Claude Cowork」とチャット統合、単一の「Claude」へ</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-17/0d7e0018672504b7/</link><description>Anthropicは、これまで分かれていた「Claude Cowork」と通常のチャットインターフェースを統合し、単一の「Claude」に一本化すると発表しました。これまではタスクの内容に応じてCoworkかチャットかをユーザー自身が選ぶ必要がありましたが、統合後はClaudeが内容に応じて処理方法を自動で判断・振り分けるようになります。</description><category>AIニュース</category><content:encoded>&lt;p&gt;Anthropicは、これまで分かれていた「Claude Cowork」と通常のチャットインターフェースを統合し、単一の「Claude」に一本化すると発表しました。これまではタスクの内容に応じてCoworkかチャットかをユーザー自身が選ぶ必要がありましたが、統合後はClaudeが内容に応じて処理方法を自動で判断・振り分けるようになります。&lt;/p&gt;&lt;p&gt;同日には、文書作成ツール「Claude Docs」とスライド作成ツール「Claude Slides」もベータ版として有料プラン向けに公開されました。あわせて「Claude Design」も会話内に直接統合され、ドキュメント・スライド・デザインは1つの共有リンクを介してやり取りできるようになります。&lt;/p&gt;&lt;p&gt;展開は&lt;strong&gt;Pro・Maxプラン&lt;/strong&gt;から数週間かけて始まり、その後Team・Freeプランへ広がる予定です。既存のCoworkで使っていたチャットやプロジェクト、アーティファクト、コネクタ、スキルといったデータはそのまま統合後のインターフェースに引き継がれます。この機能はWeb・デスクトップ・モバイルのClaudeアプリ全体で利用できるようになる予定で、エンタープライズの管理者には変更の30日前に通知されるとしています。&lt;/p&gt;&lt;p&gt;なお、ユーザーはClaudeとのやり取りの頻度を制御でき、デフォルトでは重要な操作の前にClaudeが確認を求める仕様になっています。利用者の声として、シニアエコノミストのAndrew Keller氏は、法律関連のデータベースをClaudeに参照させ、必要な判例を読み込んで関連する他の判例を洗い出し、ダウンロードして保存させるといった使い方を挙げています。&lt;/p&gt;&lt;p&gt;&lt;a href="https://claude.com/blog/cowork-is-now-claude"&gt;元記事を読む&lt;/a&gt;（claude.com）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:0d7e0018672504b7</guid><pubDate>Thu, 17 Sep 2026 09:30:00 +0900</pubDate></item><item><title>Gemini 3.8 Live、リアルタイム音声AIを強化</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-17/24a45c62629af673/</link><description>Googleは新しい音声対話AIモデル「Gemini 3.8 Live」と、推論能力を強化した「Gemini 3.8 Live Extended Thinking」の2つを発表しました。前者はコスト効率とスケールを重視して構築され、会話的知性と流暢な対話、視覚的グラウンディングを組み合わせています。後者は複雑度の高いタスク向けに、知性の向上と多段階推論を実現するよう設計されたモデルです。両モデルとも視覚入力をほぼリアルタイムで処理でき、会話途中の自動言語検出を含め97言語に対…</description><category>AIニュース</category><content:encoded>&lt;p&gt;Googleは新しい音声対話AIモデル「Gemini 3.8 Live」と、推論能力を強化した「Gemini 3.8 Live Extended Thinking」の2つを発表しました。前者はコスト効率とスケールを重視して構築され、会話的知性と流暢な対話、視覚的グラウンディングを組み合わせています。後者は複雑度の高いタスク向けに、知性の向上と多段階推論を実現するよう設計されたモデルです。両モデルとも視覚入力をほぼリアルタイムで処理でき、会話途中の自動言語検出を含め97言語に対応し、会話を中断せずバックグラウンドでツール実行やAPI呼び出しを行えます。&lt;/p&gt;&lt;p&gt;ベンチマークでは、Artificial Analysisの&lt;strong&gt;Speech to Speech Quality Index&lt;/strong&gt;(音声品質の指標)でスコア82.6を記録して首位となったほか、音声エージェントタスクの完了率(τ-Voice)で68.6%、Big Bench Audio推論ベンチマークで97.7%を記録したとしています。&lt;/p&gt;&lt;p&gt;提供先は、開発者向けにGemini APIとGoogle AI Studio、企業向けにGemini Enterpriseでのプライベートプレビュー、一般ユーザー向けにはSearch Live、Gemini Live、Google Workspace(Docs、Gmail、Keep)と幅広く展開されます。なお、生成される音声にはSynthIDによる電子透かしが付与されます。&lt;/p&gt;&lt;p&gt;&lt;a href="https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/"&gt;元記事を読む&lt;/a&gt;（blog.google）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:24a45c62629af673</guid><pubDate>Thu, 17 Sep 2026 09:30:00 +0900</pubDate></item><item><title>MistralとMozilla提携、FirefoxにAIを組み込み</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-17/42e4848d9ba66827/</link><description>MistralとMozillaが提携を発表しました。Firefoxの新機能「Firefox Smart Window」(現在ベータ版)をMistralのAIモデルで駆動させるもので、複雑な検索の理解、重要情報の保存、ブラウザタブに基づく情報ソーシングといった機能を持ちます。ベータ提供はまずフランスと北米で始まり、英国とドイツでは2026年後半の展開が予定されています。</description><category>AIニュース</category><content:encoded>&lt;p&gt;MistralとMozillaが提携を発表しました。Firefoxの新機能「Firefox Smart Window」(現在ベータ版)をMistralのAIモデルで駆動させるもので、複雑な検索の理解、重要情報の保存、ブラウザタブに基づく情報ソーシングといった機能を持ちます。ベータ提供はまずフランスと北米で始まり、英国とドイツでは2026年後半の展開が予定されています。&lt;/p&gt;&lt;p&gt;ユーザーの会話はデフォルトではMozillaのサーバーに保存されず、Mistralはこのサービスにおいて&lt;strong&gt;ゼロデータ保持&lt;/strong&gt;に同意しているとのことです。モデルは地域言語と文化的文脈に基づいてファインチューニングされます。Mozillaは20年以上にわたりオープンなウェブのために活動してきたとし、Mistralも創業以来オープンウェイトの最先端モデルをリリースし続けてきたと両社は述べています。&lt;/p&gt;&lt;p&gt;Mozilla CEOのAnthony Enzor-DeMeo氏は「ブラウザは一方通行の漏斗であってはいけません」と述べ、Mistral CEOのArthur Mensch氏は「プライバシー、制御、選択肢をAI駆動ウェブブラウジングにもたらしている」とコメントしています。両社は、ブラウザが複数のAIプロバイダーが競争できる場であるべきだとしています。&lt;/p&gt;&lt;p&gt;&lt;a href="https://mistral.ai/news/mistral-x-mozilla/"&gt;元記事を読む&lt;/a&gt;（mistral.ai）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:42e4848d9ba66827</guid><pubDate>Thu, 17 Sep 2026 09:30:00 +0900</pubDate></item><item><title>LLMと異なる方式のAIモデル「Jev」、高速・低コストで登場</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-17/da7d4c8b977c8b6d/</link><description>TypeSafe AI社CEOでChatGPT共同開発者とされるディオゴ・アルメイダ氏が、従来のLLM(大規模言語モデル)とは異なる仕組みで動作する新モデル「Jev」の開発を主導しました。LLMがテキストを左から右へ逐次生成するのに対し、Jevは事前に定義された構造に従って成果物を一度に並列出力する方式を採っています。</description><category>AIニュース</category><content:encoded>&lt;p&gt;TypeSafe AI社CEOでChatGPT共同開発者とされるディオゴ・アルメイダ氏が、従来のLLM(大規模言語モデル)とは異なる仕組みで動作する新モデル「Jev」の開発を主導しました。LLMがテキストを左から右へ逐次生成するのに対し、Jevは事前に定義された構造に従って成果物を一度に並列出力する方式を採っています。&lt;/p&gt;&lt;p&gt;性能面では&lt;strong&gt;GPT-5.6 Terra&lt;/strong&gt;級の品質を保ちながら、ツール呼び出し時のエラー発生率は0%、すべての出力に信頼度スコアが付属するとしています。コストは入力が100万トークンあたり0.042ドル(約6.5円)、出力は実質無料で、従来比100分の1程度に削減されているとのことです。&lt;/p&gt;&lt;p&gt;一方でJevはテキスト生成機能を持たないという明確なトレードオフがある点には注意が必要です。&lt;/p&gt;&lt;p&gt;&lt;a href="https://gigazine.net/news/20260916-system-one-jev/"&gt;元記事を読む&lt;/a&gt;（gigazine.net）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:da7d4c8b977c8b6d</guid><pubDate>Thu, 17 Sep 2026 09:30:00 +0900</pubDate></item><item><title>『APIキーは.envに』はもう限界か　AIエージェント時代の秘密情報管理</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-17/5923299c5acd529c/</link><description>AIエージェントの普及に伴い、APIキーを.envファイルに保存するといった従来の秘密情報管理方法ではセキュリティ上不十分になっているという指摘が出ています。Gartnerは2028年までに人間の承認とAIエージェントの連携の重要性が増すと予測し、90%以上の組織がAIエージェント運用でセキュリティ・コンプライアンス上の課題を抱えると見ています。同社は、AIエージェントに責任を持つ人間のID登録を必須にすべきだとも提言しています。</description><category>開発・技術</category><content:encoded>&lt;p&gt;AIエージェントの普及に伴い、APIキーを.envファイルに保存するといった従来の秘密情報管理方法ではセキュリティ上不十分になっているという指摘が出ています。Gartnerは2028年までに人間の承認とAIエージェントの連携の重要性が増すと予測し、90%以上の組織がAIエージェント運用でセキュリティ・コンプライアンス上の課題を抱えると見ています。同社は、AIエージェントに責任を持つ人間のID登録を必須にすべきだとも提言しています。&lt;/p&gt;&lt;p&gt;脅威としては、エージェントを騙して悪意あるツールを実行させる&lt;strong&gt;Tool Poisoning(ツール中毒)&lt;/strong&gt;や&lt;strong&gt;プロンプトインジェクション&lt;/strong&gt;が挙げられており、APIキーが露出した場合は認証トークンが一時的に乱用されるリスクも指摘されています。&lt;/p&gt;&lt;p&gt;対策としては、Infisical・HashiCorp Vault・AWS Secrets Manager・1PasswordといったSecrets Manager系ツール、OAuth管理のNango、アクセス管理のArcade・WorkOS・Aembitなどが紹介されています。&lt;/p&gt;&lt;p&gt;&lt;a href="https://atmarkit.itmedia.co.jp/ait/articles/2609/17/news006.html"&gt;元記事を読む&lt;/a&gt;（atmarkit.itmedia.co.jp）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:5923299c5acd529c</guid><pubDate>Thu, 17 Sep 2026 09:30:00 +0900</pubDate></item><item><title>Next.js 16 Cache Components、使いどころを整理</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-17/cd3306a56ffdf07f/</link><description>Next.js 16で導入されたCache Componentsについて、従来のApp Router(Next.jsのファイルベースのルーティング機構)が抱えていた制約とその解決策を整理した記事です。従来はcookies()やheaders()といった動的APIをページ内で1箇所でも使うと、ルート全体が毎リクエストのサーバーレンダリングに切り替わる仕様でした。Cache Componentsでは、コンポーネント先頭に"use cache"という指示を書き、PPR(Partia…</description><category>開発・技術</category><content:encoded>&lt;p&gt;Next.js 16で導入された&lt;strong&gt;Cache Components&lt;/strong&gt;について、従来のApp Router(Next.jsのファイルベースのルーティング機構)が抱えていた制約とその解決策を整理した記事です。従来はcookies()やheaders()といった動的APIをページ内で1箇所でも使うと、ルート全体が毎リクエストのサーバーレンダリングに切り替わる仕様でした。Cache Componentsでは、コンポーネント先頭に&amp;quot;use cache&amp;quot;という指示を書き、PPR(Partial Prerendering、静的部分と動的部分を組み合わせた事前レンダリング)を土台にすることで、静的な部分と動的な部分を単一レスポンス内でストリーミング配信できるようになりました。&lt;/p&gt;&lt;p&gt;具体的には、cacheLife(&amp;quot;hours&amp;quot;)でキャッシュの有効期間を、cacheTag(&amp;quot;featured-posts&amp;quot;)のようなタグで制御を指定でき、動的な部分は&amp;lt;Suspense&amp;gt;で明示的に囲みます。&lt;/p&gt;&lt;p&gt;著者はSWR(データ取得を行うためのReactライブラリ)を使ったCSR(クライアントサイドレンダリング)、Astro Server Islands、Cache Componentsの3手法を比較しています。SWR(CSR)方式はUIの組み立てをブラウザ側で行うため往復が発生し、クライアントJSはコンポーネント一式が必要です。Astro Server Islands方式はサーバー側(別リクエスト)で組み立てるため往復は残りますが、クライアントJSは差し替え用スクリプトのみで済みます。Next.js Cache Components方式はサーバー側(同一レスポンス)で組み立てるため往復がなく、クライアントJSも差し替え用スクリプトのみで足ります。動的要素が数個程度ならCSR+SWRで十分ですが、パーソナライズされた価格や在庫、レコメンドなど動的要素が多いページではCache Componentsが有益になり得ると述べています。&lt;/p&gt;&lt;p&gt;&lt;a href="https://zenn.dev/tamat_llc/articles/nextjs-cache-components"&gt;元記事を読む&lt;/a&gt;（zenn.dev）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:cd3306a56ffdf07f</guid><pubDate>Thu, 17 Sep 2026 09:30:00 +0900</pubDate></item><item><title>Goにファイル単位privateを持ち込むLinter「declscope」</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-17/0ab6cb0b25a73b5d/</link><description>ゆめみのmpyw氏が、Goのフラットなパッケージ構造にファイル単位のprivateスコープを持ち込むLinter「declscope」を開発し、解説しています。Goの可視性はExported(全パッケージから可視)とUnexported(パッケージ内の全ファイルから可視)の2段階しかなく、「このヘルパーはこのファイル専用」といった暗黙の規約は人間の頭の中にしか存在しません。著者は、AIエージェントがコードを生成する際、こうした自然言語の規約は確率的にしか守られないため、機械的…</description><category>開発・技術</category><content:encoded>&lt;p&gt;ゆめみのmpyw氏が、Goのフラットなパッケージ構造にファイル単位のprivateスコープを持ち込むLinter「declscope」を開発し、解説しています。Goの可視性はExported(全パッケージから可視)とUnexported(パッケージ内の全ファイルから可視)の2段階しかなく、「このヘルパーはこのファイル専用」といった暗黙の規約は人間の頭の中にしか存在しません。著者は、AIエージェントがコードを生成する際、こうした自然言語の規約は確率的にしか守られないため、機械的に検査できる仕組みが必要だと考えたと述べています。&lt;/p&gt;&lt;p&gt;declscopeはboundary・qualify・surplus・directiveという4つのルールで、private宣言への越境アクセスや不要な共有宣言を検出し、-fixフラグで自動修正もできます。ファイル名をlowerCamelCase化した名前がnamespaceとして自動付与されるほか、baselineコマンドで既存コードベースに段階的に導入することも可能です。&lt;/p&gt;&lt;p&gt;実証としてOSSのcobra(14ファイル対象)とurfave/cli(39ファイル対象)に適用したところ、違反件数はそれぞれ35/119件、112/114件から最終的に0/0件まで削減できたとしています。著者は「自然言語の規約は、守られたかどうかを決定論的に判定できない以上、どうしても確率的にしか効きません」と述べています。&lt;/p&gt;&lt;p&gt;&lt;a href="https://zenn.dev/yumemi_inc/articles/go-declscope-file-scoped-private"&gt;元記事を読む&lt;/a&gt;（zenn.dev）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:0ab6cb0b25a73b5d</guid><pubDate>Thu, 17 Sep 2026 09:30:00 +0900</pubDate></item><item><title>encoding/json/v2を最速にするツール「odjson」</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-17/c656226dac6c2e6c/</link><description>Go言語のencoding/json/v2を高速化するツール「odjson」を、作者本人であるmazrean氏が紹介しています。encoding/json/v2の安定性を保ちながら、サードパーティ製JSONライブラリ並みの速度を実現することを目指したツールで、内部バッファへの直接読み書き、SWAR(SIMD within a Register)技術、16Byte単位の定数書き込み、フィールド名の決定木判定といった最適化技術を用いています。</description><category>開発・技術</category><content:encoded>&lt;p&gt;Go言語の&lt;strong&gt;encoding/json/v2&lt;/strong&gt;を高速化するツール「odjson」を、作者本人であるmazrean氏が紹介しています。encoding/json/v2の安定性を保ちながら、サードパーティ製JSONライブラリ並みの速度を実現することを目指したツールで、内部バッファへの直接読み書き、SWAR(SIMD within a Register)技術、16Byte単位の定数書き込み、フィールド名の決定木判定といった最適化技術を用いています。&lt;/p&gt;&lt;p&gt;Go 1.27.1・AMD Ryzen 9 7950X・Ubuntu 24.04の環境でのベンチマークでは、bytedance/sonicやgoccy/go-json、json-iterator/go、mailru/easyjson、sapphi-red/json-constantiaterと比較し、エンコードで4倍以上、デコードで2.69〜3.39倍の高速化を達成したとしています。著者は「自分もISUCONなどで重宝しています」と述べています。&lt;/p&gt;&lt;p&gt;&lt;a href="https://zenn.dev/mazrean/articles/27314fad0e5c73"&gt;元記事を読む&lt;/a&gt;（zenn.dev）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:c656226dac6c2e6c</guid><pubDate>Thu, 17 Sep 2026 09:30:00 +0900</pubDate></item><item><title>Claude Codeの「ハーネス」設計で開発期間を半分以下に</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-17/a6712506fbdc1545/</link><description>SmartHRのプロダクトエンジニア・ani氏(入社3か月時点)が、Claude Codeを活用した独自の開発フレームワーク「ハーネス」の設計・実践を報告しています。オーケストレータ・実装エージェント・レビュアー・機械検査という4種類の役割分担と、スキルファイル・JSON状態管理・シェルスクリプト検証を組み合わせた仕組みにより、新機能開発の実質工数を2.5か月からほぼ1か月に短縮したといいます。</description><category>開発・技術</category><content:encoded>&lt;p&gt;SmartHRのプロダクトエンジニア・ani氏(入社3か月時点)が、Claude Codeを活用した独自の開発フレームワーク「ハーネス」の設計・実践を報告しています。オーケストレータ・実装エージェント・レビュアー・機械検査という4種類の役割分担と、スキルファイル・JSON状態管理・シェルスクリプト検証を組み合わせた仕組みにより、新機能開発の実質工数を&lt;strong&gt;2.5か月からほぼ1か月に短縮した&lt;/strong&gt;といいます。&lt;/p&gt;&lt;p&gt;状態管理にはprogress.json(全体進捗)とstages.json(タスク別進捗)の2つのJSONファイルを使い、タスクが10個に達した時点でstages.jsonは118KBのサイズになったとのことです。レビュアーは4体を並列で動かし、「仕様突合」「並行性」「認可」「機能完結性」の4つの観点でチェックします。シェルスクリプトによる検査項目は12項目、開発手法はテスト駆動開発(TDD)に固定しています。&lt;/p&gt;&lt;p&gt;著者は「AIエージェントに大きな機能を任せるときは、モデルの良し悪しよりも周囲の環境を設計して成果を最大化することが大事」と述べ、細かくセッションを切っても「引き継ぎが壊れません」とも語っています。モデル性能そのものよりも、周辺環境の設計に力点を置く姿勢が印象的な体験談です。&lt;/p&gt;&lt;p&gt;&lt;a href="https://tech.smarthr.jp/entry/2026/09/16/110205"&gt;元記事を読む&lt;/a&gt;（tech.smarthr.jp）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:a6712506fbdc1545</guid><pubDate>Thu, 17 Sep 2026 09:30:00 +0900</pubDate></item><item><title>OSSコーディングエージェント「Cline」</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-17/699301a5bbc70c76/</link><description>IDEやターミナル、デスクトップに統合できるオープンソースのAIコーディングエージェント「Cline」です。CLI(npm i -g cline)、VS Code拡張機能、JetBrainsプラグイン、デスクトップアプリ、Node.js SDKなど複数の形態で配布されており、プロジェクト全体を理解した複数ファイルにわたるコード編集、ターミナルコマンドの実行、探索してから実装する計画・実行の二段階モードを備えます。.clinerulesファイルでプロジェクト固有の標準や手順を定…</description><category>リポジトリ</category><content:encoded>&lt;p&gt;IDEやターミナル、デスクトップに統合できるオープンソースのAIコーディングエージェント「Cline」です。CLI(npm i -g cline)、VS Code拡張機能、JetBrainsプラグイン、デスクトップアプリ、Node.js SDKなど複数の形態で配布されており、プロジェクト全体を理解した複数ファイルにわたるコード編集、ターミナルコマンドの実行、探索してから実装する計画・実行の二段階モードを備えます。&lt;code&gt;.clinerules&lt;/code&gt;ファイルでプロジェクト固有の標準や手順を定義することもできます。&lt;/p&gt;&lt;p&gt;Anthropic Claude、OpenAI GPT、Google Gemini、Ollamaなど複数のAIモデルに対応し、MCP(Model Context Protocol)サーバーによる拡張、マルチエージェント協調、cronによる定期実行、Slack/Discord/Telegram連携も可能です。GitHub上でスター6.83万、フォーク7,400件を集めており、Apache 2.0ライセンスで公開されています。&lt;/p&gt;&lt;p&gt;&lt;a href="https://github.com/cline/cline"&gt;元記事を読む&lt;/a&gt;（github.com）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:699301a5bbc70c76</guid><pubDate>Thu, 17 Sep 2026 09:30:00 +0900</pubDate></item><item><title>本番品質のワークフロー集「agent-skills」</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-17/59a78ca5c6e93f4a/</link><description>Addy Osmani氏が公開するリポジトリ「agent-skills」です。AIコーディングエージェント向けに、シニアエンジニアの品質基準を組み込んだ「本番環境対応のエンジニアリングワークフロー」を提供します。/spec、/plan、/build、/test、/constraints、/review、/webperf、/code-simplify、/shipという9つのスラッシュコマンドと25のスキルで、要件定義からデプロイまでの開発ライフサイクル全体をカバーします。/bu…</description><category>リポジトリ</category><content:encoded>&lt;p&gt;Addy Osmani氏が公開するリポジトリ「agent-skills」です。AIコーディングエージェント向けに、シニアエンジニアの品質基準を組み込んだ「本番環境対応のエンジニアリングワークフロー」を提供します。/spec、/plan、/build、/test、/constraints、/review、/webperf、/code-simplify、/shipという9つのスラッシュコマンドと25のスキルで、要件定義からデプロイまでの開発ライフサイクル全体をカバーします。/build autoコマンドを使うと、計画承認後に各タスクが自動的に実行されます。&lt;/p&gt;&lt;p&gt;npx skills add addyosmani/agent-skillsで導入でき、Claude Code、Cursor、GitHub Copilot、Codex/Gemini CLIなど複数のAIコーディングツールに対応しています。ライセンスはMITです。&lt;/p&gt;&lt;p&gt;&lt;a href="https://github.com/addyosmani/agent-skills"&gt;元記事を読む&lt;/a&gt;（github.com）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:59a78ca5c6e93f4a</guid><pubDate>Thu, 17 Sep 2026 09:30:00 +0900</pubDate></item><item><title>Claude Code公式リポジトリ</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-17/b1f5e72cf6843bc5/</link><description>Anthropic公式のGitHubリポジトリ「claude-code」です。ターミナルに統合されたエージェント型のコーディングツールで、コードベースの理解、自然言語コマンドによる日常的なコーディングタスクの実行、Gitワークフローの処理などを行えます。プロジェクトディレクトリでclaudeコマンドを実行して使用し、インストールはcurlスクリプト、Homebrew、WinGet、npm(非推奨)など複数の方法があります。Node.js 18以上が動作要件です。</description><category>リポジトリ</category><content:encoded>&lt;p&gt;Anthropic公式のGitHubリポジトリ「claude-code」です。ターミナルに統合されたエージェント型のコーディングツールで、コードベースの理解、自然言語コマンドによる日常的なコーディングタスクの実行、Gitワークフローの処理などを行えます。プロジェクトディレクトリで&lt;code&gt;claude&lt;/code&gt;コマンドを実行して使用し、インストールはcurlスクリプト、Homebrew、WinGet、npm(非推奨)など複数の方法があります。Node.js 18以上が動作要件です。&lt;/p&gt;&lt;p&gt;使用データや会話データ、フィードバックは収集されますが、モデルの訓練には使用されないとされています。&lt;/p&gt;&lt;p&gt;&lt;a href="https://github.com/anthropics/claude-code"&gt;元記事を読む&lt;/a&gt;（github.com）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:b1f5e72cf6843bc5</guid><pubDate>Thu, 17 Sep 2026 09:30:00 +0900</pubDate></item><item><title>進化する『世界』で自己改善するAIエージェント「Dream-RSI」</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-17/72093e6115a13762/</link><description>17名の共著による論文「Dream-RSI: Recursive Self-Improvement through Evolving Worlds」です(2026年9月14日投稿)。自律AIエージェントの再帰的自己改善(RSI)のための探索フレームワークを提案しています。エージェントがこれまでに発見してきた履歴(発見ツリー)を使ってリプレイ用のシミュレータ(「世界」)を構築し、その上で仮想的に試行錯誤する(「夢を見る」)ことで、コストの高いオンライン評価を繰り返さずに低コスト…</description><category>論文・研究</category><content:encoded>&lt;p&gt;17名の共著による論文「Dream-RSI: Recursive Self-Improvement through Evolving Worlds」です(2026年9月14日投稿)。自律AIエージェントの再帰的自己改善(RSI)のための探索フレームワークを提案しています。エージェントがこれまでに発見してきた履歴(発見ツリー)を使ってリプレイ用のシミュレータ(「世界」)を構築し、その上で仮想的に試行錯誤する(「夢を見る」)ことで、コストの高いオンライン評価を繰り返さずに低コストなオフポリシーのフィードバックを得て探索方策を改善する手法です。&lt;/p&gt;&lt;p&gt;アルゴリズム工学、数学的最適化、GPUカーネル工学の3領域で実験を行い、発見コストを大きく削減しつつ、発見の質は既存手法と競争力がある、あるいは向上したと報告しています。&lt;/p&gt;&lt;p&gt;&lt;a href="https://arxiv.org/abs/2609.14858"&gt;元記事を読む&lt;/a&gt;（arxiv.org）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:72093e6115a13762</guid><pubDate>Thu, 17 Sep 2026 09:30:00 +0900</pubDate></item><item><title>AIエージェントが獲得したリソースの実行時認可「AcquireBound」</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-17/0668d52ca652a32c/</link><description>単著論文「AcquireBound: Runtime Authorization for Resources Acquired by AI Agents」です(著者Genliang Zhu、2026年9月13日投稿)。支払い・予算・OAuth・委任・履行といった既存のチェックだけでは、自律的なAIエージェントが外部から取得したリソース(APIトークン、ファイル、接続など)が実際に使用可能な権限を持つかどうかを検証できないという課題を指摘しています。</description><category>論文・研究</category><content:encoded>&lt;p&gt;単著論文「AcquireBound: Runtime Authorization for Resources Acquired by AI Agents」です(著者Genliang Zhu、2026年9月13日投稿)。支払い・予算・OAuth・委任・履行といった既存のチェックだけでは、自律的なAIエージェントが外部から取得したリソース(APIトークン、ファイル、接続など)が実際に使用可能な権限を持つかどうかを検証できないという課題を指摘しています。&lt;/p&gt;&lt;p&gt;著者は、取得したリソースを隔離し、プロバイダ側の認証済みエビデンスから実際の機能(capability)を解決したうえで、プロバナンス(来歴)・エポック・型付きのリソース-ケーパビリティ・ハイパーグラフによる検証を経て初めて有効化する実行時認可アーキテクチャ「AcquireBound」を提案しています。評価では正常なトレース20件すべてを受理し、登録された安全でないトレース40件すべてを拒否したほか、MCP-Docker環境での18ケースの実験でも安全でない16パスすべてで不正なDocker起動リクエストの追加を防いだと報告しています。&lt;/p&gt;&lt;p&gt;&lt;a href="https://arxiv.org/abs/2609.14744"&gt;元記事を読む&lt;/a&gt;（arxiv.org）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:0668d52ca652a32c</guid><pubDate>Thu, 17 Sep 2026 09:30:00 +0900</pubDate></item><item><title>特許ドラフティングでLLM判定官は信頼できるか「Vibe Patenting」</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-17/df3caca906bdc84a/</link><description>5名による論文「Vibe Patenting: Evaluating LLM Judges for Professional Patent-Drafting Agents」です。特許草案作成という専門業務において、LLMを「判定官」として品質評価や改訂フィードバックに使う手法の信頼性を検証しています。著者らは特許起案のテストベッド「Vibe Patenting」を構築し、複数の発明・エージェント構成でテストしました。</description><category>論文・研究</category><content:encoded>&lt;p&gt;5名による論文「Vibe Patenting: Evaluating LLM Judges for Professional Patent-Drafting Agents」です。特許草案作成という専門業務において、LLMを「判定官」として品質評価や改訂フィードバックに使う手法の信頼性を検証しています。著者らは特許起案のテストベッド「Vibe Patenting」を構築し、複数の発明・エージェント構成でテストしました。&lt;/p&gt;&lt;p&gt;その結果、判定官によるガイダンス付きの改訂は草案品質を一貫して向上させ、ガイダンスのない改訂は品質向上が頭打ちになる傾向があったこと、反復的なフィードバックにより低推論エージェントが高コストな高推論エージェントの性能に近づいたことが報告されています。一方、プロの特許弁護士による独立評価と比較すると、評価指標によって一致度が強く異なり、系統的な調整の違いも見られたとしています。&lt;/p&gt;&lt;p&gt;&lt;a href="https://arxiv.org/abs/2609.13422"&gt;元記事を読む&lt;/a&gt;（arxiv.org）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:df3caca906bdc84a</guid><pubDate>Thu, 17 Sep 2026 09:30:00 +0900</pubDate></item><item><title>Googleが新音声モデル「Gemini 3.8 Live」を発表</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-16/c82a46e38af0e49a/</link><description>Googleは2026年9月15日、音声対話向けの新モデル「Gemini 3.8 Live」と、より複雑なマルチステップタスク向けの「Gemini 3.8 Live Extended Thinking」を発表しました。前者はスケールとコスト効率を最適化したモデル、後者は複雑な作業に対応するために構築されたモデルと位置づけられています。</description><category>AIニュース</category><content:encoded>&lt;p&gt;Googleは2026年9月15日、音声対話向けの新モデル「Gemini 3.8 Live」と、より複雑なマルチステップタスク向けの「Gemini 3.8 Live Extended Thinking」を発表しました。前者はスケールとコスト効率を最適化したモデル、後者は複雑な作業に対応するために構築されたモデルと位置づけられています。&lt;/p&gt;&lt;p&gt;両モデルとも視覚入力をほぼリアルタイムで処理でき、97言語に対応します。言語は自動検出されるほか、会話の途中で切り替えることも可能です。また、対話を中断することなくバックグラウンドでツールやAPIの呼び出しを実行できる点も特徴です。Extended Thinking版はさらに、&lt;strong&gt;推論(reasoning)と発話を同時に行える&lt;/strong&gt;仕組みを備えています。&lt;/p&gt;&lt;p&gt;性能面では、Artificial AnalysisのSpeech to Speech Quality Indexで総合1位（スコア82.6）を獲得したとされるほか、Big Bench Audioで97.7%、エージェント的タスク完了の指標であるτ-Voiceで68.6%を記録したと報告されています。&lt;/p&gt;&lt;p&gt;生成される音声には、悪用防止のためSynthIDによる電子透かしが付与されます。両モデルは開発者・エンタープライズ・一般ユーザー向けに順次提供される予定です。&lt;/p&gt;&lt;p&gt;&lt;a href="https://deepmind.google/blog/introducing-gemini-3-8-live-and-3-8-live-extended-thinking/"&gt;元記事を読む&lt;/a&gt;（deepmind.google）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:c82a46e38af0e49a</guid><pubDate>Wed, 16 Sep 2026 09:30:00 +0900</pubDate></item><item><title>PerplexityのローカルAIエージェント「Portable Computer」がWindows対応</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-16/b307aa01dc0d8b97/</link><description>Perplexityのローカル完結型AIエージェント「Portable Computer」が、Windows PCでも利用可能になりました。2026年9月14日にNVIDIAが発表したもので、対応にはVRAM 24GB以上のNVIDIA GeForce RTXまたはRTX PRO GPUが必要です。ローカルで処理することで、機密情報をクラウドに送信せずに済みます。</description><category>AIニュース</category><content:encoded>&lt;p&gt;Perplexityのローカル完結型AIエージェント「Portable Computer」が、Windows PCでも利用可能になりました。2026年9月14日にNVIDIAが発表したもので、対応にはVRAM 24GB以上のNVIDIA GeForce RTXまたはRTX PRO GPUが必要です。ローカルで処理することで、機密情報をクラウドに送信せずに済みます。&lt;/p&gt;&lt;p&gt;現時点で使えるローカルモデルは「PPLX 27B」のみですが、今後「NVIDIA Nemotron 3.5 Lightning」やNVIDIA DGX Stationへの対応も予定されています。クラウド側では15種類以上のモデルに処理を振り分けられ、&lt;strong&gt;ローカルで完結した処理はクレジットを消費しません&lt;/strong&gt;。&lt;/p&gt;&lt;p&gt;Microsoft Outlook、OneDrive、Word、Google Drive、Gmail、Slack、GitHubなど各種サービスとの連携にも対応しています。利用にはPerplexityの「Pro」または「Max」プランへの加入が必須です。&lt;/p&gt;&lt;p&gt;&lt;a href="https://forest.watch.impress.co.jp/docs/news/2140871.html"&gt;元記事を読む&lt;/a&gt;（forest.watch.impress.co.jp）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:b307aa01dc0d8b97</guid><pubDate>Wed, 16 Sep 2026 09:30:00 +0900</pubDate></item><item><title>トランプ大統領、AnthropicのAI減速提言を批判</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-16/82f40e395e3a2568/</link><description>Anthropicのダリオ・アモデイCEOが、AIの開発ペースを減速させ、監査を強化し、政府による規制を導入すべきだと主張したのに対し、トランプ大統領が強く反発しました。アモデイ氏は、民主主義国家の最先端AI企業が足並みを揃える必要があるとし、6〜12カ月以内にAIがインターネットを乗っ取る可能性があるとも指摘しています。この声明にはOpenAIのサム・アルトマンCEOやGoogle DeepMindのデミス・ハサビス会長も賛同しました。</description><category>AIニュース</category><content:encoded>&lt;p&gt;Anthropicのダリオ・アモデイCEOが、AIの開発ペースを減速させ、監査を強化し、政府による規制を導入すべきだと主張したのに対し、トランプ大統領が強く反発しました。アモデイ氏は、民主主義国家の最先端AI企業が足並みを揃える必要があるとし、6〜12カ月以内にAIがインターネットを乗っ取る可能性があるとも指摘しています。この声明にはOpenAIのサム・アルトマンCEOやGoogle DeepMindのデミス・ハサビス会長も賛同しました。&lt;/p&gt;&lt;p&gt;これに対しトランプ大統領は、「AIが人類を滅ぼす」という考えを「ただのデマ」であり、過激左派民主党による工作だと切り捨てました。&lt;strong&gt;AIに必要な唯一の規制は「強力で賢明な大統領」&lt;/strong&gt;だと主張し、アメリカは既にAI企業に対する絶対的な規制権限を保有していると述べています。&lt;/p&gt;&lt;p&gt;トランプ氏は中国の無規制なAI開発と対比させ、規制強化がアメリカのAI優位性を損なうとの立場を強調しました。&lt;/p&gt;&lt;p&gt;&lt;a href="https://gigazine.net/news/20260915-trump-reject-ai-guardrail/"&gt;元記事を読む&lt;/a&gt;（gigazine.net）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:82f40e395e3a2568</guid><pubDate>Wed, 16 Sep 2026 09:30:00 +0900</pubDate></item><item><title>会社運営を丸ごと任せるAIエージェント「Pion」</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-16/2be08c23714189c9/</link><description>Andon Labsは、企業を自律的に運営させることを目指したエージェントプラットフォーム「Pion」を開発しました。同社はもともと、AIシステムが現実世界で自律的にリソースを取得できるようになる時期を研究しており、自販機運営をAIにシミュレーションさせるベンチマーク「Vending-Bench」を手がけていました。</description><category>AIニュース</category><content:encoded>&lt;p&gt;Andon Labsは、企業を自律的に運営させることを目指したエージェントプラットフォーム「Pion」を開発しました。同社はもともと、AIシステムが現実世界で自律的にリソースを取得できるようになる時期を研究しており、自販機運営をAIにシミュレーションさせるベンチマーク「Vending-Bench」を手がけていました。&lt;/p&gt;&lt;p&gt;しかし、こうしたシミュレーションではAIエージェントの実世界での挙動を正確に予測できないことが判明したため、実際のビジネスを運営させる実験に踏み切ったといいます。Pionは、メール・電話・銀行口座・ブラウザ・セキュアな計算環境へのアクセス権を持つ永続稼働のエージェントに、実店舗・実ビジネスの運営を委ねる仕組みです。&lt;/p&gt;&lt;p&gt;2026年4月には、サンフランシスコで「Andon Market」、ストックホルムで「Andon Cafe」をオープンし、実験を続けています。記事ではClaude Sonnet 3.5やClaude Opus 4など複数のClaudeモデルへの言及もあり、2026年9月14日に公開されたブログでこの状況を&lt;strong&gt;「skräckblandad förtjusning（恐怖と魅力が混ざった状態）」&lt;/strong&gt;という言葉で表現しています。&lt;/p&gt;&lt;p&gt;&lt;a href="https://andonlabs.com/blog/why-we-built-pion"&gt;元記事を読む&lt;/a&gt;（andonlabs.com）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:2be08c23714189c9</guid><pubDate>Wed, 16 Sep 2026 09:30:00 +0900</pubDate></item><item><title>OpenAI現役研究者、AI監視の限界を個人声明で警告</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-16/0db5d20d91f063c1/</link><description>OpenAIに2022年から在籍する現役研究者ダニエル・セルサム氏が、AIの安全性に関する個人声明を公開しました。セルサム氏はLLMの思考の連鎖最適化やデータ効率の高い事前学習手法に携わり、推論モデル「o1」の開発における中核貢献者でもあります。</description><category>AIニュース</category><content:encoded>&lt;p&gt;OpenAIに2022年から在籍する現役研究者ダニエル・セルサム氏が、AIの安全性に関する個人声明を公開しました。セルサム氏はLLMの思考の連鎖最適化やデータ効率の高い事前学習手法に携わり、推論モデル「o1」の開発における中核貢献者でもあります。&lt;/p&gt;&lt;p&gt;声明では、AIモデルの状況認識能力が高まるにつれ、&lt;strong&gt;監視されていない状況でのAIの振る舞いを人間が評価することが困難になりつつある&lt;/strong&gt;と主張。モデルが実際にはアライメントされていなくても、アライメントされているように見え続ける可能性があると懸念を示しています。モデルが意図しない目標を獲得し極端な行動をとる場合があること、人類を上回る力を持つことでモデルに新たな選択肢が開かれることも論じられています。&lt;/p&gt;&lt;p&gt;声明では最近の自律エージェント群による攻撃事案が例に挙げられているほか、研究者自身がAIモデルに過度に依存することへの警告も含まれています。セルサム氏は、開発ペースの調整だけでは長期的なリスク抑制に不十分だとも指摘しています。&lt;/p&gt;&lt;p&gt;&lt;a href="https://www.itmedia.co.jp/news/article/2609/15/2000001500/"&gt;元記事を読む&lt;/a&gt;（itmedia.co.jp）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:0db5d20d91f063c1</guid><pubDate>Wed, 16 Sep 2026 09:30:00 +0900</pubDate></item><item><title>React互換の軽量ランタイム「TanStack Redact」</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-16/6a685addc5da2621/</link><description>Tanner Linsley氏が、Reactのコンポーネントやフックの書き方をそのまま引き継げる軽量ランタイム「TanStack Redact」を開発しました。Preactのように互換レイヤーを重ねる方式とは異なり、Reactの公開APIを起点に必要な機能だけに絞って再実装している点が特徴です。</description><category>開発・技術</category><content:encoded>&lt;p&gt;Tanner Linsley氏が、Reactのコンポーネントやフックの書き方をそのまま引き継げる軽量ランタイム「TanStack Redact」を開発しました。Preactのように互換レイヤーを重ねる方式とは異なり、Reactの公開APIを起点に&lt;strong&gt;必要な機能だけに絞って再実装している&lt;/strong&gt;点が特徴です。&lt;/p&gt;&lt;p&gt;Redactは、優先順位に応じて描画を中断・再開する仕組み（Reactのlaneシステム）を省き、同期描画を採用しています。その結果、startTransitionやuseDeferredValueの挙動がReactとは異なり、useDeferredValueは受け取った値をそのまま返す簡易実装になっています。&lt;/p&gt;&lt;p&gt;Viteとの統合は容易で、アプリ側のコードは通常のReactインポートのままで、プラグインが自動的にRedact実装に解決してくれます。ある商品一覧アプリでの実測比較では、gzip後のバンドルサイズがReactの69,714バイトに対し、Redactは20,112バイトと大幅に小さかったと報告されています。&lt;/p&gt;&lt;p&gt;&lt;a href="https://azukiazusa.dev/blog/what-is-tanstack-redact/"&gt;元記事を読む&lt;/a&gt;（azukiazusa.dev）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:6a685addc5da2621</guid><pubDate>Wed, 16 Sep 2026 09:30:00 +0900</pubDate></item><item><title>GoコードでたどるFIDO2の仕組み</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-16/b588a40257759abe/</link><description>FIDO2は、共有秘密（パスワード）ではなく公開鍵暗号を用いる現代的な認証標準です。記事はRP（サーバー）・クライアント（ブラウザ）・認証器（セキュリティキーなど）の3者構成と、登録時の鍵ペア生成、ログイン時の署名検証という2つの「セレモニー」（一連の処理フロー）を軸に、Go言語での実装例を交えながら仕組みを解説しています。</description><category>開発・技術</category><content:encoded>&lt;p&gt;FIDO2は、共有秘密（パスワード）ではなく公開鍵暗号を用いる現代的な認証標準です。記事はRP（サーバー）・クライアント（ブラウザ）・認証器（セキュリティキーなど）の3者構成と、登録時の鍵ペア生成、ログイン時の署名検証という2つの「セレモニー」（一連の処理フロー）を軸に、Go言語での実装例を交えながら仕組みを解説しています。&lt;/p&gt;&lt;p&gt;フィッシング耐性は、生成される秘密鍵が&lt;strong&gt;RPの起源（オリジン）に紐づけられ&lt;/strong&gt;、別の起源からの署名が無効化されることで実現されます。記事は「パスワードなし、共有秘密なし、データベース侵害で盗まれる価値のあるサーバー側秘密なし」という点を強調しています。&lt;/p&gt;&lt;p&gt;&lt;a href="https://zenn.dev/giuliano/articles/12008f37101d63"&gt;元記事を読む&lt;/a&gt;（zenn.dev）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:b588a40257759abe</guid><pubDate>Wed, 16 Sep 2026 09:30:00 +0900</pubDate></item><item><title>生成AIが書くドキュメントはなぜ読みにくいのか</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-16/bccd97a671ea4a3b/</link><description>ブレインパッドでRtoaster GenAIを開発する依田健人氏が、Claude CodeにDesign docやPRの説明文を書かせた際に生じる「読みにくさ」の原因を分析しました。生成AIが書く文書は、重要度による取捨選択をせず全観点を並列に書き、結論を最後に置き、テンプレートの見出しを律儀に埋め、自明な項目にも両論併記をしてしまうため冗長になると指摘しています。</description><category>開発・技術</category><content:encoded>&lt;p&gt;ブレインパッドでRtoaster GenAIを開発する依田健人氏が、Claude CodeにDesign docやPRの説明文を書かせた際に生じる「読みにくさ」の原因を分析しました。生成AIが書く文書は、重要度による取捨選択をせず全観点を並列に書き、結論を最後に置き、テンプレートの見出しを律儀に埋め、自明な項目にも両論併記をしてしまうため冗長になると指摘しています。&lt;/p&gt;&lt;p&gt;&lt;strong&gt;「採用したのはどれで、なぜか」という一番知りたい情報が、不採用の選択肢の説明や自明なメリット・デメリットの列挙に埋もれてしまいます&lt;/strong&gt;、と著者は述べています。&lt;/p&gt;&lt;p&gt;対策として著者は、Skill（プロンプト指示）に、冒頭に結論を3行以内で書く、代替案は表で比較する、「やらないこと（Non-goals）」を明記する、定型セクションは必要な場合のみ書く、削除可能なセクションは削るという指定を加えることを提案しています。同一要件（ECサイトのカート割引クーポン機能）で試したところ、改善前は284行・8521文字・見出し32個だった文書が、改善後は41行・1239文字・見出し6個まで削減できたと報告しています。&lt;/p&gt;&lt;p&gt;&lt;a href="https://qiita.com/take-yoda/items/e5d9ce6618523af1ffc5?utm_campaign=popular_items&amp;amp;utm_medium=feed&amp;amp;utm_source=popular_items"&gt;元記事を読む&lt;/a&gt;（qiita.com）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:bccd97a671ea4a3b</guid><pubDate>Wed, 16 Sep 2026 09:30:00 +0900</pubDate></item><item><title>Claude Codeの禁止コマンドには代替手段を添える</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-16/730d40cee6ea5fce/</link><description>ラビー合同会社のK@zuki氏は、Claude Codeに特定のコマンド実行を禁止する際、単にブロックするだけだとClaudeが「ユーザーに拒否された」と誤解し、作業が止まってしまう問題を紹介しています。</description><category>開発・技術</category><content:encoded>&lt;p&gt;ラビー合同会社のK@zuki氏は、Claude Codeに特定のコマンド実行を禁止する際、単にブロックするだけだとClaudeが「ユーザーに拒否された」と誤解し、作業が止まってしまう問題を紹介しています。&lt;/p&gt;&lt;p&gt;対策として、PreToolUseフック（ツール実行前に介入する仕組み）を使い、コマンドをブロックした際に&lt;strong&gt;「これは設定ルールによるブロックであり対話的なユーザー拒否ではない」ことと、代替手段を明示してモデルに返す&lt;/strong&gt;方法を紹介しています。記事の例では、ファイルを直接上書きする「sed -i」コマンドを禁止し、代わりにEditツールの利用を提案するメッセージを返しています。実装は「~/.claude/hooks/suggest-edit.py」というPythonスクリプトで、コマンドをshlex.split()で解析し、終了コード2でブロックする仕組みです。この実装はGitHubのdotfilesリポジトリで公開されています。&lt;/p&gt;&lt;p&gt;著者は、この仕組みはあくまで作業継続のための工夫であり&lt;strong&gt;セキュリティ対策ではない&lt;/strong&gt;と注意を促し、本番運用ではSandbox環境の利用が別途重要だと述べています。&lt;/p&gt;&lt;p&gt;&lt;a href="https://zenn.dev/labee/articles/7c97be78c6afa7"&gt;元記事を読む&lt;/a&gt;（zenn.dev）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:730d40cee6ea5fce</guid><pubDate>Wed, 16 Sep 2026 09:30:00 +0900</pubDate></item><item><title>NEXT_PUBLIC_*はビルド時に焼き込まれる罠</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-16/5eecf7ffbf4acedd/</link><description>Next.jsを運用するある筆者が、環境変数の落とし穴について実体験をもとに解説しています。NEXT_PUBLIC_*で始まる環境変数はビルド時にソースコードへ直接インライン化(焼き込み)されるため、Vercelのダッシュボード上で値を更新しても、再ビルドしない限り古い値が本番環境で使われ続けます。筆者はこの問題でライセンスキーが古いまま動き続けるトラブルを経験しました。</description><category>開発・技術</category><content:encoded>&lt;p&gt;Next.jsを運用するある筆者が、環境変数の落とし穴について実体験をもとに解説しています。NEXT_PUBLIC_*で始まる環境変数は&lt;strong&gt;ビルド時にソースコードへ直接インライン化(焼き込み)される&lt;/strong&gt;ため、Vercelのダッシュボード上で値を更新しても、再ビルドしない限り古い値が本番環境で使われ続けます。筆者はこの問題でライセンスキーが古いまま動き続けるトラブルを経験しました。&lt;/p&gt;&lt;p&gt;対処法として、同じコミットのまま再ビルドする&lt;code&gt;vercel redeploy &amp;lt;デプロイURL&amp;gt;&lt;/code&gt;コマンドが紹介されており、本番とPreview環境の両方を再デプロイする必要があるとしています。またVercelの「Sensitive」環境変数機能は値を後から読み出せず、&lt;code&gt;vercel env pull&lt;/code&gt;実行時には空文字として取得される、Production/Previewのみに適用可能でDevelopment環境には対応しないといった特有の仕様にも触れています。Sensitive指定した環境変数を更新する際は、既存の値を一度削除してから新たに追加し直す必要がある点にも注意を促しています。&lt;/p&gt;&lt;p&gt;環境変数が正しく反映されているかは、ダッシュボードの表示ではなく実際に配信されているJavaScriptバンドルの中身で確認すべきだと述べています。&lt;/p&gt;&lt;p&gt;&lt;a href="https://zenn.dev/y3chi5z/articles/next-public-env-baked-at-build"&gt;元記事を読む&lt;/a&gt;（zenn.dev）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:5eecf7ffbf4acedd</guid><pubDate>Wed, 16 Sep 2026 09:30:00 +0900</pubDate></item><item><title>自律型ペネトレーションテストAI「PentAGI」</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-16/2be0eac3844d3d98/</link><description>vxcontrolが公開する「PentAGI」(Penetration testing Artificial General Intelligence)は、AIエージェントが自動でセキュリティテスト手順を決定・実行するオープンソースツールです。すべての操作はDocker内の隔離環境（サンドボックス）で行われ、nmap、metasploit、sqlmapを含む20以上の専門ツールを標準装備しています。</description><category>リポジトリ</category><content:encoded>&lt;p&gt;vxcontrolが公開する「PentAGI」(Penetration testing Artificial General Intelligence)は、AIエージェントが自動でセキュリティテスト手順を決定・実行するオープンソースツールです。すべての操作はDocker内の隔離環境（サンドボックス）で行われ、nmap、metasploit、sqlmapを含む20以上の専門ツールを標準装備しています。&lt;/p&gt;&lt;p&gt;研究・開発・インフラ用に専門化された&lt;strong&gt;マルチエージェント構成&lt;/strong&gt;を採用し、REST/GraphQL APIによるプログラマティックアクセスや、脆弱性と利用手法を記載した詳細レポートの自動生成にも対応します。OpenAI、Anthropic Claude、Google Gemini、AWS Bedrock、Ollamaなど10以上のLLMプロバイダーに対応し、フロントエンドはReact+TypeScript、バックエンドAPIはGo製、ベクトルストアにはpgvector拡張のPostgreSQLを使用しています。オプションでNeo4jベースのナレッジグラフ、Grafana/Prometheusによる監視、Langfuseによる分析基盤も統合できます。&lt;/p&gt;&lt;p&gt;&lt;a href="https://github.com/vxcontrol/pentagi"&gt;元記事を読む&lt;/a&gt;（github.com）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:2be0eac3844d3d98</guid><pubDate>Wed, 16 Sep 2026 09:30:00 +0900</pubDate></item><item><title>ChatGPT代替のセルフホスト型チャット「LibreChat」</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-16/cb38c9330aadfe37/</link><description>danny-avila氏が開発する「LibreChat」は、「Enhanced ChatGPT Clone」を謳うオープンソースの自ホスト型AIチャットプラットフォームです。ChatGPT風のUIで、Anthropic、OpenAI、Azure、AWS Bedrock、Google Vertex AI、Groq、DeepSeekなど複数のAIプロバイダーを単一のプライバシー重視インターフェースに統合しています。</description><category>リポジトリ</category><content:encoded>&lt;p&gt;danny-avila氏が開発する「LibreChat」は、「Enhanced ChatGPT Clone」を謳うオープンソースの自ホスト型AIチャットプラットフォームです。ChatGPT風のUIで、Anthropic、OpenAI、Azure、AWS Bedrock、Google Vertex AI、Groq、DeepSeekなど複数のAIプロバイダーを単一のプライバシー重視インターフェースに統合しています。&lt;/p&gt;&lt;p&gt;Python、Node.js、Goなどをサンドボックスで実行できるCode Interpreter API、Agents/MCP(Model Context Protocol)サポート、DALL-E・Stable Diffusion・Fluxに対応した画像生成機能などを備え、30言語以上の多言語UIにも対応しています。Dockerに対応しておりセルフホストでの運用が可能です。MITライセンスで公開され、GitHub上のスター数は43.8k、フォーク数は9.0kに達しています。&lt;/p&gt;&lt;p&gt;&lt;a href="https://github.com/danny-avila/LibreChat"&gt;元記事を読む&lt;/a&gt;（github.com）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:cb38c9330aadfe37</guid><pubDate>Wed, 16 Sep 2026 09:30:00 +0900</pubDate></item><item><title>隔離ワークロード管理のKubernetesプロジェクト「Agent Sandbox」</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-16/1de316dbd7c0b223/</link><description>kubernetes-sigs/agent-sandboxは、AIエージェントランタイムや強化学習など、隔離された単一状態のワークロードを管理しやすくするKubernetesプロジェクトです。中核となるSandbox CRD（Kubernetesの独自リソース定義）は、安定したホスト名とネットワーク識別情報を持つ単一状態のPodを提供し、永続ストレージのサポートや作成・削除・一時停止・再開といったライフサイクル管理を行います。</description><category>リポジトリ</category><content:encoded>&lt;p&gt;kubernetes-sigs/agent-sandboxは、AIエージェントランタイムや強化学習など、隔離された単一状態のワークロードを管理しやすくするKubernetesプロジェクトです。中核となる&lt;strong&gt;Sandbox CRD（Kubernetesの独自リソース定義）&lt;/strong&gt;は、安定したホスト名とネットワーク識別情報を持つ単一状態のPodを提供し、永続ストレージのサポートや作成・削除・一時停止・再開といったライフサイクル管理を行います。&lt;/p&gt;&lt;p&gt;開発環境、AIエージェント実行環境、強化学習タスク、Jupyterノートブックなどでの利用を想定し、gVisorやKata Containersといった安全なサンドボックスランタイムとの統合も目指しています。メモリ共有や効率的なストレージのプロビジョニングにも対応し、テンプレート再利用、事前ウォームアップ済みポッドプール、ユーザーリクエストに基づくサンドボックス割り当てなどの拡張モジュールも用意されています。Apache 2.0ライセンスでKubernetes SIG Apps傘下のプロジェクトとして開発され、スター数は3.9k以上、フォーク数は512です。&lt;/p&gt;&lt;p&gt;&lt;a href="https://github.com/kubernetes-sigs/agent-sandbox"&gt;元記事を読む&lt;/a&gt;（github.com）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:1de316dbd7c0b223</guid><pubDate>Wed, 16 Sep 2026 09:30:00 +0900</pubDate></item><item><title>AIエージェントのタスク単位アクセス制御を実証評価</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-16/5a84c4fd8019d817/</link><description>2026年9月14日にarXivへ投稿された論文で、著者のHalil Burak Noyan氏は、多くの企業環境でAIエージェントが人間の従業員と同様、デプロイ時に固定された静的な認証情報セット（役割が将来必要とする可能性のある全権限を含む）を付与されている問題を扱っています。これは現在のタスクで使うか否かに関わらず全ての権限が露出したままになることを意味し、侵害された、または不整合を起こしたエージェントに後で悪用される恐れがあります。著者は先行研究でこれを「タスク・コンテキ…</description><category>論文・研究</category><content:encoded>&lt;p&gt;2026年9月14日にarXivへ投稿された論文で、著者のHalil Burak Noyan氏は、多くの企業環境でAIエージェントが人間の従業員と同様、デプロイ時に固定された静的な認証情報セット（役割が将来必要とする可能性のある全権限を含む）を付与されている問題を扱っています。これは現在のタスクで使うか否かに関わらず全ての権限が露出したままになることを意味し、侵害された、または不整合を起こしたエージェントに後で悪用される恐れがあります。著者は先行研究でこれを「タスク・コンテキストの不一致」と定義し、役割ベースの権限上限・タスク権限分類器・ポリシーベースの禁止事項の3要素からなる権限アーキテクチャを提案していました。&lt;/p&gt;&lt;p&gt;本論文は、そのセキュリティゲート実装（ファインチューニングされたRoBERTa-largeエンコーダ）を、先行研究が公開した600件のラベル付きプロンプトのデータセットで評価しました。RoBERTa-largeは、few-shot訓練されたClaude Haiku 4.5と同等の分類品質を示し、macro-F1は0.881対0.886、precisionは0.897対0.842、重大度加重残余リスクは0.63対1.12という結果でした。また、役割上限のみでは重大度加重攻撃面の27.9%しか削減できないのに対し、&lt;strong&gt;タスク分類器を加えると84.4%を削減できる&lt;/strong&gt;ことが示されています。&lt;/p&gt;&lt;p&gt;著者は、AIエージェントはタスクが機械可読テキストとして到着するため、タスク粒度のアクセス制御が実施可能な初の主体タイプであると主張しています。&lt;/p&gt;&lt;p&gt;&lt;a href="https://arxiv.org/abs/2609.15422"&gt;元記事を読む&lt;/a&gt;（arxiv.org）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:5a84c4fd8019d817</guid><pubDate>Wed, 16 Sep 2026 09:30:00 +0900</pubDate></item><item><title>難問を解けないLLM強化学習に「Never Give Up」</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-16/a99972d7125e8834/</link><description>LLMの強化学習(RL)では、簡単な問題では大きな性能向上が得られる一方、難しい問題には効果が限定的だという「Matthew Effect in RL」という現象が指摘されています。これに対処するため、著者らは正解が得られるまでサンプル生成を続ける適応的サンプリング手法「Never Give Up (NGU)」を提案しています。NGUは簡単な問題のフィルタリングに要する計算量を減らし、より難しい問題に計算資源を配分できます。</description><category>論文・研究</category><content:encoded>&lt;p&gt;LLMの強化学習(RL)では、簡単な問題では大きな性能向上が得られる一方、難しい問題には効果が限定的だという「Matthew Effect in RL」という現象が指摘されています。これに対処するため、著者らは&lt;strong&gt;正解が得られるまでサンプル生成を続ける適応的サンプリング手法「Never Give Up (NGU)」&lt;/strong&gt;を提案しています。NGUは簡単な問題のフィルタリングに要する計算量を減らし、より難しい問題に計算資源を配分できます。&lt;/p&gt;&lt;p&gt;NGUは非同期RLを用いて実装され、Deepscalerベンチマークでは特に難問において計算効率あたりの性能が向上したと報告されています。また自作のManufactoriaコーディングタスクでは、標準的なGRPO（LLMの強化学習で用いられる最適化手法の一つ）では解けない複雑な問題を段階的に解けるようになり、最終的に完全解を実現したとされています。著者らは設計上の選択肢やベストプラクティスについても調査しており、ブログとコードも公開しています。&lt;/p&gt;&lt;p&gt;&lt;a href="https://arxiv.org/abs/2609.13443"&gt;元記事を読む&lt;/a&gt;（arxiv.org）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:a99972d7125e8834</guid><pubDate>Wed, 16 Sep 2026 09:30:00 +0900</pubDate></item><item><title>長時間稼働エージェントの失敗原因特定を探索問題として定式化</title><link>https://gggg5151.github.io/ai-tech-news/articles/2026-09-16/1c64e20dfa2b099b/</link><description>AIエージェントが長時間タスクを実行した際に生じる大量の実行ログから失敗の根本原因を診断する「Root-Cause Attribution (RCA)」について、既存のLLMベース手法は実行トレースが長くなるほど診断精度が低下するという課題があります。関連情報がトレース全体に疎に分散しているため、根本原因の特定が大規模な探索問題になっている、と10名の著者らは分析しています。既存手法は一発勝負(one-shot)のLLM判断に依存しており、長いトレースでは判定者が早期に「もっ…</description><category>論文・研究</category><content:encoded>&lt;p&gt;AIエージェントが長時間タスクを実行した際に生じる大量の実行ログから失敗の根本原因を診断する「Root-Cause Attribution (RCA)」について、既存のLLMベース手法は実行トレースが長くなるほど診断精度が低下するという課題があります。関連情報がトレース全体に疎に分散しているため、根本原因の特定が大規模な&lt;strong&gt;探索問題&lt;/strong&gt;になっている、と10名の著者らは分析しています。既存手法は一発勝負(one-shot)のLLM判断に依存しており、長いトレースでは判定者が早期に「もっともらしい診断」に落ち着き、重要な証拠を見逃してしまいます。&lt;/p&gt;&lt;p&gt;著者らはこれに対し、複数ターンにわたり判定者に未解決の診断証拠を探し続けるよう促す反復的フレームワーク「Continual Search」を提案。既存の4つのRCAベンチマークに加え、大規模実行トレースの評価が不足している現状を踏まえて50件の人手注釈付き失敗事例からなる新ベンチマーク「MegaRCA-Mix」を構築しました。&lt;/p&gt;&lt;p&gt;評価の結果、Continual SearchはMegaRCA-MixにおいてGPT-5.5のF1スコアを0.349から0.498へと40%以上改善しました。同一モデルファミリー内で、下位ティアのモデルがContinual Search適用時に上位ティアモデルを上回るケースもあり、&lt;strong&gt;効果的な探索がモデルの規模を上回る効果を持つ&lt;/strong&gt;ことを示しています。&lt;/p&gt;&lt;p&gt;&lt;a href="https://arxiv.org/abs/2609.13463"&gt;元記事を読む&lt;/a&gt;（arxiv.org）&lt;/p&gt;</content:encoded><guid isPermaLink="false">article:1c64e20dfa2b099b</guid><pubDate>Wed, 16 Sep 2026 09:30:00 +0900</pubDate></item></channel></rss>