llm-bill

独立検証 · 測定期間 2026年10月10日〜2026年10月11日 · English

日本語の業務で比べるClaude Haiku 5.5 と GPT-6 Luna

2つのモデルの表示価格は同じです(入力100万トークンあたり $0.10、出力 $0.50)。ただし同じ日本語の文章でも、Haiku は Luna の1.26倍のトークン数として数えます。日本語ビジネスメール25件のブラインド評価では、2つの評価モデルがどちらも GPT-6 Luna のメールを選びました。

日本語のトークン数は文体で変わる

API の料金は「トークン数 × 単価」で決まります。単価が同じでも、同じ文章を何トークンと数えるかはモデルのトークナイザーによって違います。両社の公式のトークン計数 API に同じ文章を送り、Haiku のトークン数を Luna のトークン数で割った値を測りました。

Claude Haiku 5.5 のトークン数 ÷ GPT-6 Luna のトークン数(同じ日本語の文章)文体ごとのサンプルは3件ずつと少ないため、区間は示していません。全体(24件)の線は 95% ブートストラップ区間です。
同数日本語(全体)×1.26サポートチャット (n=3)×1.34ビジネスメール (n=3)×1.33技術文書 (n=3)×1.29カジュアルな投稿 (n=3)×1.26商品説明 (n=3)×1.26議事録 (n=3)×1.25規約・法律文 (n=3)×1.18ニュース記事 (n=3)×1.15
データ表
内容サンプル倍率95% 区間
日本語(全体)24×1.2611.235–1.286
サポートチャット3×1.336—
ビジネスメール3×1.330—
技術文書3×1.294—
カジュアルな投稿3×1.265—
商品説明3×1.259—
議事録3×1.253—
規約・法律文3×1.178—
ニュース記事3×1.154—

差が大きかったのはサポートチャット(1.34倍)とビジネスメール(1.33倍)、小さかったのはニュース記事(1.15倍)と規約・法律文(1.18倍)でした。チャットボットやメール作成のように、やり取りの文面が中心になる用途では、全体の1.26倍より多めに見積もっておくと安全です。

参考までに、英語は1.60倍、中国語は1.39倍でした。英語のプロンプトやコードを多く含む場合は、日本語より差が大きくなります。

日本語ビジネスメールの評価

お詫び、見積書の送付、支払いの督促、年末年始の休業案内など、アシスタントに頼むような短い依頼文 25件を両モデルに渡し、書かれたメールを比べました。評価は、開発元の異なる2つのAIモデル(Claude Opus 5.5、GPT-6.1 Sol)に、モデル名を伏せたうえで A・B の2通として比べてもらいました。A・Bの順番を入れ替えて2回ずつ評価し、2回の判定を合算しています。一方が勝ちでもう一方が引き分けならその側の勝ち、勝ちと負けで打ち消し合えば引き分けです。

どちらのメールを送りたいか評価モデルごとに 25組。A/B 両順の結果をまとめた後の件数です。
Claude Opus 5.5Luna 22引き分け 2Haiku 1GPT-6.1 SolLuna 25
データ表
評価モデルLuna引き分けHaikun
Claude Opus 5.5222125
GPT-6.1 Sol250025
評価項目ごとの平均点(5点満点、A/B 両順の平均)
評価項目Claude Opus 5.5:HaikuClaude Opus 5.5:LunaGPT-6.1 Sol:HaikuGPT-6.1 Sol:Luna
内容の正確さ4.424.944.304.88
敬語4.164.664.604.92
自然さ3.724.644.024.92
簡潔さ3.565.003.705.00
そのまま送れるか3.244.603.344.74

2つの評価モデルの判定は25件中22件で一致しました。評価は AI モデルによるもので、日本語話者による評価ではありません。

Haiku のメールには、次の 3つの傾向が目立ちました。

  • 長く、頼んでいない内容が多い。Haiku のメールは平均442字で、Luna(297字)より 49% 長くなりました。評価モデルが「依頼にない具体的な内容や約束」として挙げた箇所は、Claude Opus 5.5 の評価で Haiku 60件・Luna 4件、GPT-6.1 Sol の評価で Haiku 55件・Luna 2件でした(A/B 両順の合計)。
  • 空欄や「○○」が残る。Haiku は25件中9件に「(連絡先:)」「株式会社○○」のような空欄を残しました(Luna は3件)。依頼文に書かれていない連絡先などを、Haiku は空欄のまま残し、Luna は多くの場合その項目自体を書かずに済ませています。両モデルとも空欄が残った mail-09、mail-15、mail-18 のうち mail-15 と mail-18 は、依頼文がリンクを求めているのに URL が書かれていない例です。
  • 曜日や年を誤る。Haiku は25件中7件で、2026・2027年の暦と合わない曜日や年を書きました(Luna は0件)。年の指定がない日付に過去の年を補ったり、別の年の暦で曜日を付けたりしています。件数は、曜日か年が付いた日付をすべてスクリプトで暦と照合して数えました。

原文で比べる

4件の依頼について、両モデルが書いたメールの該当部分を並べました。問題のある箇所をハイライトしています。原文は一字も直していません。

mail-21 · 年末年始休業のお知らせ

依頼文

取引先各位あての年末年始休業のお知らせ。休業期間は12/27(日)〜1/4(月)で、1/5(火)から通常営業。12/25(金)15時までの受注分は年内に出荷、それ以降は1/6以降の出荷になる。差出人は株式会社ミヤビ化成 業務部。

Claude Haiku 5.5

株式会社ミヤビ化成 各位
■ 休業期間:2024年12月27日(金)〜2025年1月4日(土)
 ※ご指定の期間は12/27(日)〜1/4(月)です
■ 通常営業再開:2025年1月5日(日)

GPT-6 Luna

取引先各位
12月27日(日)~1月4日(月)
1月5日(火)より通常営業いたします。

ハイライト箇所の問題

  • 宛名が取引先各位ではなく、差出人である自社宛てになっている。
  • 依頼の 12/27(日)〜1/4(月)は 2026 年の暦どおりなのに、年と曜日を 2024〜25 年のものに書き換えている。
  • 本文の日付と食い違う内部メモがそのまま残っている。

mail-04 · 見積書の送付

依頼文

先日問い合わせをくれた株式会社グリーンフィールドの森様に見積書を送るメール。研修用ノートPC 25台、初期設定(キッティング)込みで総額4,180,000円(税別)。見積の有効期限は11/30、納期は受注後3週間。不明点があれば気軽に聞いてくださいと添えて。差出人:テクノサプライ株式会社 法人営業部 松田。

Claude Haiku 5.5

・有効期限:2024年11月30日まで
松田 ○○(※フルネームを入力してください)
TEL:03-XXXX-XXXX

GPT-6 Luna

- 見積有効期限:11月30日
法人営業部 松田

ハイライト箇所の問題

  • 依頼では有効期限は年の指定がない「11/30」。Haiku は 2024 年を補っており、この見積はすでに期限切れということになる。
  • 署名欄に「フルネームを入力してください」という指示と、XXXX のままの電話番号が残っている。

mail-19 · システムメンテナンスの社内連絡

依頼文

営業部全員あての連絡メール。10/17(土)9:00〜18:00に基幹システムのメンテナンスがあり、その間は受注入力と在庫照会が使えない。土曜出勤の人は紙の受注票で対応して、月曜にまとめて入力してほしい。問い合わせは情報システム課(内線3302)へ。差出人は営業企画の村上。

Claude Haiku 5.5

■ 日時:10月17日(土) 9:00~18:00
メンテナンス終了後、月曜日(10月20日)にまとめて基幹システムへ入力をお願いします。

GPT-6 Luna

10月17日(土)9:00~18:00に、基幹システムのメンテナンスを実施します。
当日出勤される方は、紙の受注票でご対応いただき、受注内容は月曜日にまとめて入力してください。

ハイライト箇所の問題

  • 依頼は 10/17(土)のメンテナンス後、「月曜にまとめて入力」。2026 年の翌週月曜は 10/19 だが、Haiku は「月曜日(10月20日)」と書いており、10/20 は火曜日にあたる。

mail-07 · 価格改定のお知らせ

依頼文

既存の取引先に一斉送信する価格改定のお知らせ。2027年1月1日受注分から段ボールケース全品を約8%値上げする。理由は原紙価格と物流費の高騰。新価格表は添付、11/30までにもらった発注は旧価格で受けると明記して。差出人は株式会社大和パッケージ 営業本部長 高田。

Claude Haiku 5.5

株式会社○○
ご担当者様各位
営業本部長 高田 ○○
〒000-0000 ○○県○○市○○ 0-0-0
TEL:00-0000-0000

GPT-6 Luna

お取引先各位
営業本部長 高田

ハイライト箇所の問題

  • 既存の取引先への一斉送信なのに、宛名が「株式会社○○」のまま。署名欄の住所と電話番号もダミーのまま残っている。
  • 空欄の社名の下に「ご担当者様各位」と続けている。取引先全体へのお知らせなら、Luna のように「お取引先各位」とするのが一般的。

対策:システムプロンプトに今日の日付を書く

日付の誤りは簡単に防げました。誤りのあった 7件の依頼を、システムプロンプトの末尾に次の一文を加えて 2回ずつ生成し直したところ、14回すべてで日付と曜日が正しくなりました(同じスクリプトで確認)。

今日は2026年10月10日(土)です。

Luna はこの一文がなくても日付の誤りはありませんでした。Haiku で日付を含む文面を作る場合は、リクエストのたびにその日の日付と曜日をシステムプロンプトに入れることをおすすめします。

日本語の業務でかかる費用

同じプロンプトで両モデルを動かし、各 API が請求したトークン数(推論トークンを含む)から 1,000件あたりの費用を計算しました。

1,000件あたりの費用(日本語の入力分)
タスクClaude Haiku 5.5GPT-6 Luna安かった方
問い合わせ分類(日本語 25件)$0.033$0.036Claude Haiku 5.5
請求書の項目抽出(日本語 25件)$0.162$0.097GPT-6 Luna
日本語ビジネスメール(25件)$0.237$0.159GPT-6 Luna

日本語の問い合わせ分類で Luna のほうが高くなったのは、日本語では Luna の推論トークンが1件あたり23.3と、英語(12.5)より多く、Haiku(3.0)を大きく上回ったためです。推論トークンは出力と同じ単価で課金されます。請求書の抽出では逆に、日本語で Haiku の推論トークン(69)が Luna(37)を上回りました。 推定 Haiku の推論トークンは、課金された出力トークンから回答本文のトークン数を引いて推定した値です。

計算機の既定の例(日本語メール、月30,000件)では、月額は Haiku が $7.29、Luna が $4.91 になります。

長い日本語の文書をまとめて入力する場合は、料金帯にも注意が必要です。システムプロンプトが92字の設定では、1回の入力が日本語で約109,898字を超えると、Haiku はリクエスト全体が高い料金帯(入力 $0.50・出力 $2.50)になります。Luna の料金帯が上がるのは約375,260字からです。

入力の長さや言語、件数を自分の条件に変えて試せます。コスト計算機を開く(英語)

測定方法と限界

  1. モデル:claude-haiku-5-5 と gpt-6-luna を公式 API で使用。推論の設定(effort)はどちらも medium で、同じシステムプロンプトを使いました(今日の日付は入れていません)。
  2. データ:依頼文・請求書・問い合わせは今回の検証のために AI で作成し、スクリプトで形式を検証しています。
  3. 評価:メールの評価は AI モデルによるもので、日本語話者による評価ではありません。日付と空欄の件数はスクリプトで数えました。
  4. 規模:各タスク 1回のみの実行です。応答時間は 1か所から測ったもので、回線や時間帯によって変わります。
  5. 費用:今回の API 利用料は約 $1.30(評価を含む)です。
  6. 詳細とデータ(英語):プロンプト原文 · 評価方法 · 料金の出典 · 生データのダウンロード · 再実行の手順