mlc-ai/web-llmは、WebGPUによるハードウェア加速を活用し、サーバー不要でブラウザ内で直接LLM推論を実行するオープンソースのエンジンです。OpenAI API互換のインターフェースを備え、ストリーミング、JSONモード、シード制御、カスタムJSONスキーマによる構造化出力に対応します。

Web Worker、Service Worker、Chrome拡張機能での利用もサポートし、Llama 3、Phi 3、Gemma、Mistral、Qwenなど多数のモデルに対応。実装にはWebAssembly(WASM)とTypeScript、Apache TVMが使われ、Apache-2.0ライセンスで公開されています。GitHub上で約19,000スター、1,400フォークを集めています。

出典が伝えている要点

  • WebLLMは高性能のブラウザ内LLM推論エンジンである
  • WebLLMはWebGPUによるハードウェア加速を用いてブラウザ上で直接推論を実行する
  • WebLLMはOpenAI API互換のインターフェースを提供し、ストリーミング、JSONモード、シード制御に対応する
  • WebLLMはカスタムJSONスキーマによる構造化JSON生成に対応する
  • WebLLMはWeb Worker、Service Worker、Chrome拡張機能での利用をサポートする
  • WebLLMはLlama 3、Phi 3、Gemma、Mistral、Qwenなど多数のモデルに対応する
  • WebLLMはWebAssembly(WASM)とTypeScriptを用いて実装されている
  • WebLLMはApache TVMをコンパイラ基盤として利用している
  • WebLLMはApache-2.0ライセンスで公開されている
  • WebLLMのGitHubリポジトリは約19,000スターを獲得している
  • WebLLMのGitHubリポジトリは約1,400フォークを獲得している
  • WebLLMのGitHubリポジトリは142ウォッチャーを持つ
← 2026.09.05 の号を通しで読む