日常のコーディングにフロンティアモデルは不要

Tamago Labsは、日常の開発タスクで低コストのホスト型モデルやローカルモデルをベンチマークし、どこまで低コストで十分かを見極めます。

更新を購読

直接お届けします。スパムなし、いつでも解除できます。

ベンチマーク

知性の電気代

レスポンスあたりの消費電力は3桁変わる。ワット時あたりの精度で割ると、リーダーボードの順位は入れ替わる。

445×ワット時あたりの成功率が も高い ― Gemma 2B〈Raspberry Pi〉での成功率はClaude Opus 4.7より高く、フロンティアは多くのタスクで使われないヘッドルームに電力を費やしている。
Model Cost / 1M Success % Success / $ Energy / resp Success / Wh
Gemma 2B (Pi 5)Gemma 2B (Pi 5)free30%0.0056 Wh5,357
Gemma 4BGemma 4Bfree45%0.025 Wh1,800
Llama 4 70BLlama 4 70B$0.6062%103.30.200 Wh310.0
DeepSeek V4DeepSeek V4$0.9074%82.21.5 Wh49.3
GLM 5.2GLM 5.2$1.4077%55.02.0 Wh38.5
Claude Sonnet 4.6Claude Sonnet 4.6$3.5080%22.93.1 Wh25.8
Kimi K3Kimi K3$3.0084%28.03.6 Wh23.3
Claude Opus 4.7Claude Opus 4.7$10.0077%7.76.4 Wh12.0

コストは1Mトークンあたりの定価〈ブレンド〉。成功率は広範なベンチマーク。Energy / respは推定値 — ベンダー発表値ではない。ヘッダーをクリックで並び替え。

ワット時あたりの精度でランク付け — 簡単なタスクでは小さなローカルモデルが上位に来る。

プロダクト

Tamago LabsのローカルAIを試す

Gemma 4やQwen 2.5 Coderを無料で — あなたのコンピューターで直接。クラウド課金なし、データは外に出ません。

npx @tamago-labs/everclaw
GitHubで見る →
  • オフライン — インターネット不要、マシン内で完結。
  • プライベート — データはローカルに残り、クラウドに送られません。
  • 無料 — APIキー不要、トークン単価なし。
  • ワンコマンド — Gemma 4かQwen 2.5 Coderを選んで会話律始。
ブログ

最新ニュースとレビュー

すべて見る →