← 一覧へ
📊 調べる・分析CC / Codex 両対応難易度: 中級
AIモデル比較ベンチマーク benchmark-models
AIモデルを横並びで比較しよう!
これは何?
これは、複数のAIモデルを同じ条件で比較できる便利なツールです。Claude、GPT(Codex経由)、Geminiの3つのモデルに同時に同じ質問を投げかけ、それぞれの応答速度・トークン使用量・コストなどを比較できます。客観的なデータに基づいて、あなたのタスクに最適なモデルを選ぶ手助けをします。

これでできること
- 複数のAIモデルの応答速度を比較できます
- 各モデルのトークン使用量と推定コストを確認できます
- LLM判定による応答品質の比較が可能です
- 特定のタスクに最適なモデルをデータで判断できます
こんな時に便利
プロンプトの最適な実行モデルを選びたい時
コストパフォーマンスの良いモデルを知りたい時
複数モデルの出力品質を比較したい時
AI開発でベンチマークデータが欲しい時
使い方
「benchmark models」や「compare models」と入力するだけで簡単に使えます。比較したいプロンプトを入力すると、3つのモデルが同時に処理し、結果を並べて表示します。速度やコストの違いが一目でわかるので、初心者の方でも直感的に理解できますよ。
使用例(こう頼んでみよう)
benchmark models こんにちは!と日本語で挨拶する文章を生成してくださいcompare models PythonでFizzBuzzを書くコードを生成してwhich model is best for ビジネスメールの草案作成必要なもの
- 特になし
導入方法
いちばん簡単(AIに頼む)
次のスキルを入れて: https://github.com/garrytan/gstack/tree/main/benchmark-models手動で置く
Claude Code →
~/.claude/skills/benchmark-models/Codex →
~/.agents/skills/benchmark-models/使いこなしのコツ
- 品質比較にはLLM判定機能を活用しましょう
- コスト敏感なタスクではトークン使用量に注目
- 速度優先か品質優先か、目的に応じて比較軸を変えてみよう