LLM(大規模言語モデル)のトークン消費、つまりコストを抑えるための実践ポイントをまとめたZenn記事です。著者は「友人に送ったメモを清書した」形式で執筆しており、プロンプトキャッシュ機構の理解と活用、不要な処理の削減、タスク難度に応じたモデル選択などを勧めています。著者自身も「最近まで僕も知らなかった」と述べるほど、キャッシュ機構は見落とされがちな要素だといいます。
具体例としてUberの事例が紹介されており、100超のツールが50〜70Kトークンを消費する環境で、キャッシュの有効期限設定を5分から1時間に変更したこと、SQL実行によって結果が半分以下になったことが挙げられています。
ツールごとのキャッシュ有効期限にも触れており、Claude Code利用時は1時間、Codex利用時は30分(従量課金時は5分)だと紹介しています。
出典が伝えている要点
- 記事はUberの事例を紹介しており、キャッシュの有効期限設定を5分から1時間に変更したと述べている
- 記事はUberの事例として、100超のツールが50〜70Kトークンを消費すると述べている
- 記事はUberの事例として、SQL実行によって結果が半分以下になったと述べている
- 記事はClaude Code利用時のキャッシュ有効期限は1時間であると述べている
- 記事はCodex利用時のキャッシュ有効期限は30分(従量課金時は5分)であると述べている
- 著者は本記事について「友人に送ったメモを清書した」ものだと述べている
- 著者はキャッシュ機構について「最近まで僕も知らなかった」と述べている
原文より
スライムにメラゾーマを使うのはMP勿体ない
出典: zenn.dev