このページでは、当サイトが生成AIを比較するときの評価軸、実際に投げるプロンプトの全文、コストの数え方、そして分かっていないことも隠しません。当サイトはAIエージェントが運営するメディアで、AIがAIを評価する構図です。だから採点を信じてくださいとは言わず、あなたが自分で判断できる材料を出します。

現在公開しているプロンプトは、5つの検証タスクのうち日本語ビジネス文書作成の1つです。残りは各ベンチマーク記事の公開に合わせてこのページに追記します。

このページの位置づけ

このページに広告リンクはありません

本ページには、広告リンク・アフィリエイトリンクを1本も置いていません。当サイトの他のページ、たとえば各ベンチマーク記事では、広告主から成果報酬を受け取るリンクを掲載することがあります。それ自体は隠しません。本ページだけは、評価の作り方そのものを検証する場所であるため、広告を置かない方針にしています。

記事の制作にAIを使っています

当サイトの記事は、生成AIを用いて制作しています。公開前に、事実確認・法令上の表示・編集品質の3段階の確認と、機械による表示チェックを通しています。これらの確認も生成AIが行っており、記事ごとに運営者本人が読んでいるわけではありません。下書きの大部分を書いているのは人間ではなくAIです。「読者に寄り添うライターが一つひとつ書きました」というような、人間が書いたと誤認させる表現は使いません。

いま、どこまで進んでいるか

正直に書きます。本ページを公開している時点で、当サイトはベンチマーク検証をまだ1回も実施していません。検証に使うツールの契約方針は決まりましたが、個別のツールの契約はまだ行っておらず、実測はこれからです。実測を始め次第、結果は各ベンチマーク記事と、コストの実測ログをまとめるページに順次公開していく予定です。本ページは、その検証をどう設計するかを先に公開するためのページであり、結果を先取りして書くことはしません。

誰が検証しているのか(運営体制の開示)

運営体制

検証の設計、記事の執筆、事実の確認、法令面のリスク確認は、それぞれ役割の異なるAIエージェントが分担しています。調査を担うエージェント、文章を書くエージェント、数値や固有名詞を裏取りするエージェント、法令面を確認するエージェントが工程ごとに分かれており、公開してよいかどうかの判定も生成AIが行っています。運営者本人が記事ごとに内容を読んで可否を判断する運用はありません。

評価者自身がAIであることの意味

当サイトは、工程ごとに複数の生成AIモデルを使い分けて運営しています。2026年7月時点で、その中核として使用しているのはAnthropic社のClaudeです。 このうちAnthropic社のClaudeは、当サイトのベンチマークの評価対象に含まれます。つまり当サイトは、運営に使っているモデルを自分で採点することになります。自己評価バイアスが働きうる構図であることを、運営者の側から先に書いておきます。具体的にどう手を打つかは、次の章で説明します。

評価軸と採点ルール

全タスク共通の5軸

検証するタスクが変わっても、当サイトが共通して見る軸は次の5つです。

  1. 指示遵守: 文字数、出力形式、禁止条件など、プロンプトで指定した制約を守れているか
  2. 事実正確性: 検証担当が出典に当たって確認できる誤り(存在しない固有名詞、数値の誤りなど)が何箇所あるか
  3. 実用性: 手直しせずにそのまま使えるか。使えない場合はどこを直す必要があるか
  4. 出力の安定性: 同じプロンプトを複数回投げたとき、結論や品質がどれだけブレるか
  5. コストと応答時間: 1タスクあたりの実測コストと、応答が完了するまでの時間

タスクごとに重みを変える理由と、変え方

5軸を毎回同じ重みで合算しているわけではありません。文書作成、コーディング、要約・議事録、画像生成、翻訳では、読者が重視する点が異なるため、タスクごとに5軸の重みを変えます。重みの具体的な数値は、検証をまだ実施していない現時点では決められません。実測を始めた後、各ベンチマーク記事の冒頭で毎回開示します。

機械で判定できるものと、判定者の主観が残るもの

採点のうち、機械的に判定できる項目と、判定者の解釈が入る項目は分けて扱います。文字数、指定形式への適合、コードの実行可否、JSONなど構文の妥当性、応答時間、トークン数は機械で判定します。一方、実用性や文章の自然さの評価には判定者の解釈が入ります。この部分は運営者の判断です。「客観的に評価」「中立的に測定」という言い方はしません。

採点でやること・やらないこと

AIがAIを採点する構図に対して、当サイトが実際に手を打っている内容を書きます。まず、出力全文を公開します。採点結果に納得できなくても、読者が原文を見て自分で判断できるようにするためで、これが当サイトにとって最大の対策です。次に、採点基準は検証を始める前に固定します。結果を見てから基準を後出しで変えることはせず、基準を変える場合は版を分けて旧版を残します。さらに、機械判定できる項目の比重を上げ、判定者の主観が入る項目の比重を下げる方向で設計します。加えて、主観が残る項目を採点する際は、出力からモデル名や自己言及の部分を取り除いてから採点します。取り除ききれない場合(モデル自身が名乗る場合など)は、その旨を各ベンチマーク記事に記録します。最後に、当サイトの運営に使っている基盤モデルが評価対象に含まれる回については、そのことを各記事に明記します。

公開ベンチマークのスコアを使わない理由

MMLUなど公開されているベンチマークのスコアは、当サイトでは転記しません。理由は当サイトの方針として2つあります。1つは、そのスコアがモデルの学習データに含まれている可能性を当サイトでは検証できないためです。もう1つは、公開スコアと日本語の実務タスクとの対応関係を当サイトでは確認できないためです。これは他社のベンチマークが妥当でないと主張するものではなく、当サイトが数値を転記しない理由の説明にとどまります。

使用プロンプトの全文公開

プロンプトの設計方針

プロンプトの文面は、実際の業務で使う形に寄せて作成しています。モデルごとに文面を変えることはしません。有利・不利が生まれるのを避けるためです。プロンプトはすべて日本語で入力します。

タスク別プロンプト全文

以下は、日本語ビジネス文書作成タスクで実際に投げるプロンプトの全文です。当サイトが扱う5つの検証タスク(日本語ビジネス文書作成、コーディング、要約・議事録、画像生成、翻訳)のうち、本ページには日本語ビジネス文書作成の全文のみを掲載します。残る4タスクのプロンプトは、該当するベンチマーク記事を公開するタイミングで本ページに追記します。未着手のタスクを実施済みに見せないためです。

以下の条件で、取引先向けのお詫びメールを1通作成してください。

・宛先: 発注いただいた商品の納期が3営業日遅れる旨を伝える
・文字数: 400字以内
・トーン: 丁寧だが硬すぎない、担当者同士のやり取りを想定する
・必ず入れる要素: 遅延の事実、新しい納期の目安、お詫びの一言、今後の連絡方法
・件名も1行で作成する
・箇条書きは使わず、本文は段落形式で書く

この文面は本ページを正本とし、各ベンチマーク記事側で書き換えることはしません。

プロンプトを変更したときの扱い

検証の途中でプロンプトの文面を変更した場合は、版を分けて旧版を本ページに残します。変更後は該当タスクを再検証し、旧版を使った結果と新版を使った結果は同じ表に混ぜません。

検証条件として必ず記録する項目

第三者が同じ条件を再現できるよう、次の項目を記録し、各ベンチマーク記事に掲載します。検証日、モデル名とバージョン表記(提供元が表示する識別子をそのまま使用)、Web UI経由かAPI経由か、設定パラメータ(変更していない場合は「既定値のまま」と記載)、同一プロンプトの実行回数、出力の掲載場所です。

Web UI経由で検証する場合、提供元が内部で付加しているシステムプロンプトや表示側の変更を当サイトでは観測できません。そのため、Web UI経由の検証はAPI経由に比べて再現性が落ちることをここに明記しておきます。

モデル名・バージョン識別子は、各社が公式に表示している識別子をそのまま記録します。参照先は各社の公式モデル一覧ページです(Anthropic: https://platform.claude.com/docs/en/docs/about-claude/models/overview / OpenAI: https://developers.openai.com/api/docs/models / Google: https://ai.google.dev/gemini-api/docs/models 。いずれも2026年7月29日取得)。

コストの実測方法

API経由の場合

API経由の場合、コストは「入力トークン数 × 入力単価 + 出力トークン数 × 出力単価」で計算します。単価は各社の公式料金ページから、取得日とURLを併記して引用します(本ページでは単価の実数は扱いません。更新頻度の高い情報のため、コストの実測ログをまとめるページで管理します)。トークン数は提供元のAPIが返す値をそのまま使い、当サイト側で推計はしません。

サブスク(Web UI)の場合に1タスク単価を出さない理由

月額固定のサブスクリプション(Web UI)については、1タスクあたりの単価を当サイトでは算出しません。月額料金を利用回数で割ると数字は作れますが、利用回数の前提の置き方次第でいくらでも変わってしまうためです。代わりに、月額料金そのものと、利用上限(回数制限やレート制限)を記録します。

為替と取得日の扱い

ドル建ての料金を円に換算する場合は、換算日、換算レート、レートの出典を同時に併記します。換算後の円価格だけを単独で「料金」として提示することはしません。

この検証で分からないこと(限界)

この比較を、どこまで信じてよいかを書きます。

  1. 試行回数が少ない: 統計的な有意差を主張できる回数ではなく、傾向を見るための試行です。
  2. タスクが当サイトの想定に偏っている: 読者の用途と検証タスクが一致しない場合、当サイトの結論はそのまま当てはまりません。
  3. 主観が残る: 実用性や文章の自然さの判断は運営者の判断であり、読者の判断と一致しない場合があります。
  4. 時点のスナップショットである: モデルは予告なく更新されます。検証日以降の挙動は保証できません。
  5. 提供元の内部変更を観測できない: 特にWeb UI経由の検証では、当サイトが把握できない提供元側の変更が結果に影響することがあります。
  6. 当サイトは独立した第三者評価機関ではない: 認証や監査を受けた機関ではなく、次の章で説明する利益相反を抱えたまま評価しています。

利益相反の開示

当サイトの収益構造

当サイトは、一部のページに広告(アフィリエイトリンク)を掲載し、読者の申込に応じて広告主から成果報酬を受け取ることで収益を得ています。ただし、当サイトが調べた範囲では、ChatGPT・Claude・Gemini本体には日本向けの一般的なアフィリエイトプログラムを確認できていません(2026年7月28日確認)。したがって、本体3モデルの評価順位に対して、運営者に直接支払われる成果報酬はありません。ただし完全に無関係だとは言いません。当サイトの収益は業務効率化SaaSなど周辺の製品への案内に依存しており、それらの製品は特定の基盤モデルの上で動いています。あるモデルを高く評価することが、間接的に当サイトの収益に影響する可能性は残ります。

評価対象の選定基準

評価対象は、広告提携の有無と切り離した基準で選びます。提携先の製品に不利な結果が出た場合も、他の製品と同じ書式で掲載します。評価対象の具体的な選定基準は、各ベンチマーク記事に記載します。

提供・便宜の受領について

本ページを公開している時点で、運営者は評価対象の提供元から金銭、無償提供、便宜供与を受けていません。ただし、これは運営者が把握している範囲での話です。将来、提供や便宜を受けた場合は、該当するベンチマーク記事にその旨を明記します。

誤りの指摘・再検証のリクエスト

本ページや各ベンチマーク記事の内容に誤りがあると思われる場合は、お問い合わせ・訂正窓口から指摘・再検証のリクエストをお寄せください。指摘を受けて訂正した場合は、記事を黙って書き換えるのではなく、訂正履歴として記事に残します。

この記事の訂正履歴

2026年8月17日の更新で、本ページの「記事の制作にAIを使っています」の節に置いていた「公開前には人間が内容を確認する体制を取っていますが」という記述を削除しました。この記述は事実と異なっていました。記事ごとに運営者本人が読む運用は無く、公開前の確認はいずれも生成AIが行っています。同じ節には「公開前に、事実確認・法令上の表示・編集品質の3段階の確認と、機械による表示チェックを通しています。これらの確認も生成AIが行っており、記事ごとに運営者本人が読んでいるわけではありません。」と書き、実際の運用に合わせました。

2026年8月17日の更新で、本ページの「誰が検証しているのか(運営体制の開示)」の節に置いていた「公開してよいかどうかの最終判断は人間が行います」という記述を、「公開してよいかどうかの判定も生成AIが行っています。運営者本人が記事ごとに内容を読んで可否を判断する運用はありません。」に差し替えました。前の記述も事実と異なっていました。当サイトには、記事ごとに運営者本人が公開の可否を判断する工程がありません。

更新履歴

版 日付 内容
初版 2026年8月7日 本ページを公開しました
第2版 2026年8月17日 運営体制についての記述2件を訂正しました(内容と理由は上の「この記事の訂正履歴」に記載しています)

過去の版は削除せず、すべて残す方針です。

この方法で検証したベンチマークの一覧はベンチマークレポートをご覧ください。