← 一覧へ
📊 調べる・分析CC / Codex 両対応難易度: 中級

AIモデル比較ベンチマーク benchmark-models

AIモデルを横並びで比較しよう!

出典リポの★
118,013
最終更新
1ヶ月前
作者
garrytan

これは何?

これは、複数のAIモデルを同じ条件で比較できる便利なツールです。Claude、GPT(Codex経由)、Geminiの3つのモデルに同時に同じ質問を投げかけ、それぞれの応答速度・トークン使用量・コストなどを比較できます。客観的なデータに基づいて、あなたのタスクに最適なモデルを選ぶ手助けをします。

AIモデル比較ベンチマークの紹介マンガ

これでできること

  • 複数のAIモデルの応答速度を比較できます
  • 各モデルのトークン使用量と推定コストを確認できます
  • LLM判定による応答品質の比較が可能です
  • 特定のタスクに最適なモデルをデータで判断できます

こんな時に便利

プロンプトの最適な実行モデルを選びたい時
コストパフォーマンスの良いモデルを知りたい時
複数モデルの出力品質を比較したい時
AI開発でベンチマークデータが欲しい時

使い方

「benchmark models」や「compare models」と入力するだけで簡単に使えます。比較したいプロンプトを入力すると、3つのモデルが同時に処理し、結果を並べて表示します。速度やコストの違いが一目でわかるので、初心者の方でも直感的に理解できますよ。

使用例(こう頼んでみよう)

benchmark models こんにちは!と日本語で挨拶する文章を生成してくださいcompare models PythonでFizzBuzzを書くコードを生成してwhich model is best for ビジネスメールの草案作成

必要なもの

  • 特になし

導入方法

いちばん簡単(AIに頼む)
次のスキルを入れて: https://github.com/garrytan/gstack/tree/main/benchmark-models
手動で置く
Claude Code → ~/.claude/skills/benchmark-models/
Codex → ~/.agents/skills/benchmark-models/

使いこなしのコツ

  • 品質比較にはLLM判定機能を活用しましょう
  • コスト敏感なタスクではトークン使用量に注目
  • 速度優先か品質優先か、目的に応じて比較軸を変えてみよう