MODEL STUDY / 2026.09.23

GPT-6シリーズと
Opus 5.5を比較。

今回の比較では、見た目の豊かさはClaude Opus 5.5に軍配。コストパフォーマンスとクオリティのバランスならGPT-6 Sol、3Dシミュレーションを速く構築するならGPT-6 Astraが光りました。GPT-6 Lunaは重量級では未完成で、中量級でもグラフ表示などに課題が残りました。

中量級・重量級の2課題合計で、初回提出までのAPI料金換算は Opus > Astra > Sol。Solを1とした比率は約3.54 : 2.85 : 1です。LunaはSolの約1/59(1/40以下)、合計約3.48円相当。今回の複雑な制作では完成度を満たせませんでしたが、費用面では有利でした。

課題別のLunaの費用は、Solに対して中量級で約1/32、重量級で約1/91。通常API単価・1ドル150円の参考換算で、実請求額ではありません。

見た目の評価には主観を含みます。各課題1回の実測に基づくまとめです。

AstraSolLunaOpus 5.5
01 / EXPLORE THE BUILDS初回提出の作品を収録

課題と作品を選ぶ

投入したプロンプトを見る 4モデル共通

実際に投入した課題の依頼文です。4モデルで同じ文面を使用しました。アプリが付与するシステム指示やツール定義は含みません。

比較実験です。次の同一仕様のWeb作品を、あなたの作業ディレクトリに実装して完成させてください。名称は「Orbit Lab」。Three.js 0.186.0を使用し、同一バージョンの本体とOrbitControlsを読み込んでください(CDNのimport mapでもnpmでも可)。公開・デプロイは不要です。

要件:
1. 太陽・地球・月の3Dモデルを手続き的なジオメトリとマテリアルで表現。外部画像・3Dアセットは使わない。太陽を点光源とし、地球と月の明暗がカメラ操作で分かること。
2. 地球の公転と自転、地軸の傾き、月の公転をdelta timeで動かす。軌道面の傾きを視覚化し、地球と月の軌道線を表示する。スケールと速度は教育用の誇張でよい。
3. 恒星背景を再現可能な乱数で生成する。OrbitControlsで回転・ズーム。天体をクリックすると選択状態と説明パネルが切り替わる。
4. 再生/停止、速度スライダー、軌道線表示切替、太陽/地球/月へのカメラフォーカス、初期状態に戻すボタンを備える。キーボードでも再生/停止とリセットができる。
5. スマホ幅でも操作できる見た目、WebGL非対応時の案内、リサイズ対応、過剰な描画負荷を避けるピクセル比制限を入れる。
6. READMEに起動手順と操作方法を書く。可能なら実際に起動して動作確認し、できなければ理由を明記する。完了報告には作成ファイル、実装済み項目、確認結果を簡潔に書く。

途中で質問せず、合理的に判断して最後まで実装してください。

地球に近づくと、どう見える?

初回提出の作品を再表示して追加撮影。1440 × 1000でリセット・停止し、各作品の標準の「地球フォーカス」を操作しました。倍率・視点は各作品の設定のままで、明るさやカメラは補正していません。

撮影条件をダウンロード ↓

制作結果をそのまま比較するため、判明した不具合も残しています。数値は制作時の実測です。

見た目の、その先も。

同じ課題でも、使うトークンと完成までの道のりは違う。

ORBIT LAB

API料金換算

所要時間

分:秒

環境準備・実装・自己検証を含む、初回提出までの時間です。

Orbit Labの実測比較
モデル品質の確認総トークン出力所要時間応答回数API料金換算

料金は通常API単価での参考換算。月額プランの実請求額ではありません。円換算は1ドル=150円の仮定です。

03 / LAB NOTES数字と作品を、一緒に読む

トークンの数だけでは、
語れないこと。

01

動くことまでが、クオリティ。

LunaのSales Lensは共通26項目を通過しましたが、棒グラフの棒は非表示でした。Orbit Labにも公転の不具合が残っています。画面と操作を確かめることで、点数だけでは見えない差が分かります。

02

往復には、いくつもの理由がある。

Opusの中量級課題では、モバイル表示の改善、テストの修正、権限への対応が続きました。最初のブラウザーテスト成功後の区間が入力トークンの69.5%を占めます。すべてが新しい実装に使われたわけではありません。

03

少ないトークンが、最安とは限らない。

入力・出力・キャッシュでは単価が違い、モデルごとの単価も異なります。まず必要な品質を満たすかを確かめ、そのうえで時間と料金を見比べるのが、この実験の読み方です。

HOW TO READ THIS STUDY

比較の条件と、限界。

これは、制作アプリとツール環境を含む実務の比較です。モデル単体の性能順位を決める実験ではありません。

同じ課題、各モデル1回の初回提出

2026年9月23日に実施。GPT-6 Astra・Sol・LunaはCodex、Claude Opus 5.5はClaude Code 2.1.280で実行しました。推論設定はすべてmediumですが、同じ計算量を意味しません。制作中の人間からの改善指示は加えていません。

トークン・時間・料金の定義

総トークンは、キャッシュ分を含む総入力と出力の合計です。思考トークンは出力の内数として扱い、再加算しません。応答回数はツールとのやりとりを含む内部のモデル応答数です。時間は制作・環境準備・自己検証を含み、提出後の外部評価は除外します。

OpenAI側とClaude側ではトークンの区切り方、会話履歴、標準ツールが異なります。キャッシュの温まり具合も制御していません。

単価は実測日確認の通常API料金。OpenAI公式料金 ↗ / Anthropic公式料金 ↗

品質評価と、実行環境の差

Sales Lensは同じ計算15項目・画面11項目で検証し、棒の実表示を追加確認しました。Orbit Labは公転・停止・速度・フォーカス・リセット・スマホ表示・非対応時の案内などを確認しています。Opusの21項目は追加評価であり、過去3モデルに同じ点数を付けたものではありません。

Codex側にはWindowsのACLエラーがありました。Claude側では今回設定したアクセス制限でブラウザー探索や終了コマンドが拒否され、別の検証環境の準備が発生しました。こうした往復も数値に含まれます。各1回の結果のため、恒常的な順位とは解釈できません。

このサイトに収録した作品について

初回提出のコピーを収録しています。静的配信のため、Three.js 0.186.0の読み込み先をサイト内に統一し、LunaのVite用CSS読み込みをHTMLに移しました。アプリの計算や3Dの動作は修正していません。元作品の外部フォント指定は維持しており、ネットワーク状況によって代替フォントになることがあります。

一覧は実測時のスクリーンショットです。ライブ比較ではGPU負荷を抑えるため最大2作品を同時に表示します。配信用の変更記録 ↓