mlc-ai/web-llmは、WebGPUによるハードウェア加速を活用し、サーバー不要でブラウザ内で直接LLM推論を実行するオープンソースのエンジンです。OpenAI API互換のインターフェースを備え、ストリーミング、JSONモード、シード制御、カスタムJSONスキーマによる構造化出力に対応します。
Web Worker、Service Worker、Chrome拡張機能での利用もサポートし、Llama 3、Phi 3、Gemma、Mistral、Qwenなど多数のモデルに対応。実装にはWebAssembly(WASM)とTypeScript、Apache TVMが使われ、Apache-2.0ライセンスで公開されています。GitHub上で約19,000スター、1,400フォークを集めています。
出典が伝えている要点
- WebLLMは高性能のブラウザ内LLM推論エンジンである
- WebLLMはWebGPUによるハードウェア加速を用いてブラウザ上で直接推論を実行する
- WebLLMはOpenAI API互換のインターフェースを提供し、ストリーミング、JSONモード、シード制御に対応する
- WebLLMはカスタムJSONスキーマによる構造化JSON生成に対応する
- WebLLMはWeb Worker、Service Worker、Chrome拡張機能での利用をサポートする
- WebLLMはLlama 3、Phi 3、Gemma、Mistral、Qwenなど多数のモデルに対応する
- WebLLMはWebAssembly(WASM)とTypeScriptを用いて実装されている
- WebLLMはApache TVMをコンパイラ基盤として利用している
- WebLLMはApache-2.0ライセンスで公開されている
- WebLLMのGitHubリポジトリは約19,000スターを獲得している
- WebLLMのGitHubリポジトリは約1,400フォークを獲得している
- WebLLMのGitHubリポジトリは142ウォッチャーを持つ