1767641516
2026-01-05 19:00:00
著者による画像
# 導入
ほぼ毎週のように、新しいモデルがすべてのベンチマークで既存の AI モデルを上回り、最先端であると主張しています。
リリースから数週間以内に、フルタイムの仕事で最新の AI モデルに無料でアクセスできます。私は通常、誇大宣伝にはあまり注意を払わず、システムによって自動選択されたモデルを使用します。
しかし、私は、本番環境に出荷できる AI を使用したソフトウェアを構築したいと考えている開発者や友人を知っています。これらの取り組みは自己資金で賄われているため、その課題を達成するのに最適なモデルを見つけることが課題となります。彼らはコストと信頼性のバランスを取りたいと考えています。
このため、GPT-5.2 のリリース後、このモデルが誇大宣伝に値するかどうか、また競合他社よりも本当に優れているかどうかを理解するために実践テストを実行することにしました。
具体的には、各プロバイダーの主力モデルをテストすることにしました。 ワーク4.5を閉じる (Anthropic の最も有能なモデル)、 GPT-5.2プロ (OpenAI の最新の拡張推論モデル)、および ディープシーク V3.2 (最新のオープンソース代替手段の 1 つ)。
これらのモデルをテストするために、単一のプロンプトでプレイ可能なテトリス ゲームを構築してもらうことにしました。
各モデルの成功を評価するために使用した指標は次のとおりです。
たった 1 つのプロンプトで、モデルは機能するコードを提供できましたか?デバッグを複数回繰り返すと時間の経過とともにコストが高くなるため、このメトリックが選択されました。
プロンプトで言及されたすべての機能はモデルによって構築されましたか、それとも何かが欠けていましたか?
技術的な実装を超えて、ゲームは実際にスムーズにプレイできましたか?それとも、ユーザー エクスペリエンスに摩擦を引き起こす問題があったのでしょうか?
本番環境に対応したコードを入手するのにどれくらいの費用がかかりましたか?
# プロンプト
各 AI モデルに入力したプロンプトは次のとおりです。
完全に機能するテトリス ゲームを、ブラウザで直接開くことができる 1 つの HTML ファイルとして構築します。
要件:
ゲームの仕組み:
– テトリスのピース全 7 種類
– 壁蹴り衝突判定によるスムーズなピース回転
– 駒は自動的に落ちます。ユーザーのスコアが上がるにつれて徐々に速度が上がります。
– ビジュアルアニメーションによるラインクリア
– 「次の作品」プレビューボックス
– 駒が頂上に到達するとゲームオーバー検出
コントロール:
– 矢印キー: 左/右で移動、下で早くドロップ、上で回転
– モバイル用タッチコントロール: 左/右にスワイプして移動、下にスワイプしてドロップ、タップして回転
– スペースバーで一時停止/一時停止解除
– ゲームオーバー後に再起動するにはキーを入力してください
ビジュアルデザイン:
– 各ピースタイプのグラデーションカラー
– ピースが動いたり、ラインが消えたりするときのスムーズなアニメーション
– 角が丸いすっきりとしたUI
– リアルタイムでスコアを更新
– レベルインジケーター
– 最終スコアとリスタートボタンを備えたゲームオーバー画面
視覚的に洗練され、プレイに満足感を得ることができます。コードはクリーンでよく整理されている必要があります。
# 結果
// 1. Work 4.5 を閉じる
Opus 4.5 モデルはまさに私が求めていたものを構築しました。
UIはきれいで、指示は画面に明確に表示されました。すべてのコントロールの反応が良く、ゲームをプレイするのが楽しかったです。
ゲームプレイは非常にスムーズだったので、実際にはかなり長い時間プレイしてしまい、他のモデルのテストから脇道に逸れてしまいました。
また、Opus 4.5 では、この実用的なゲームを提供するのに 2 分もかからず、最初の試行で感銘を受けました。

Opus 4.5 によって構築されたテトリス ゲーム
// 2. GPT-5.2 プロ
価格も Opus 4.5 の 4 倍です。
このモデルに関しては多くの誇大広告があり、私も大きな期待を持って購入しました。
残念ながら、私はこのモデルが生み出すゲームには圧倒されました。
最初の試行では、GPT-5.2 Pro はレイアウトのバグのあるテトリス ゲームを作成しました。ゲームの下の列はビューポートの外にあり、駒がどこに着地するのかを見ることができませんでした。
これにより、以下のスクリーンショットに示すように、ゲームがプレイできなくなりました。

GPT-5.2 によって構築されたテトリス ゲーム
モデルがこのコードを生成するのに約 6 分かかったので、このバグには特に驚きました。
ゲームは動作しますが、バグがあります。テトリス ボードの下の行は、画面の下部で切り取られます。ピースが着地すると見えなくなり、キャンバスが表示されるビューポートを超えて広がります。
これを次の方法で修正してください。
1. ゲームボード全体がビューポートに収まるようにする
2. ボード全体が見えるように適切なセンタリングを追加します。
ゲームは、すべての行が表示された状態で画面に収まる必要があります。

GPT-5.2によるテトリス2回目のトライ
ただし、ゲームプレイは Opus 4.5 モデルほどスムーズではありませんでした。
駒を落とすために「下」矢印を押すと、次の駒が瞬間的に高速で急降下することがあり、どのように配置するかを考える時間がありませんでした。
結局、ゲームは各ピースを自然に落下させた場合にのみプレイ可能となりましたが、これは最高のエクスペリエンスではありませんでした。
(注: GPT-5.2 標準モデルも試しましたが、最初の試行で同様のバグのあるコードが生成されました。)
// 3.ディープシーク V3.2
DeepSeek がこのゲームを構築する最初の試みには 2 つの問題がありました。
- ピースが画面の下に到達すると消え始めました。
- 駒をより速くドロップするために使用される「下」矢印は、ゲームの駒を移動するだけでなく、Web ページ全体をスクロールすることになりました。

DeepSeek V3.2 によって構築されたテトリス ゲーム
この問題を修正するためにモデルを再プロンプトしたところ、ゲームプレイ コントロールが正しく動作するようになりました。
しかし、いくつかの破片は着陸する前に消えてしまいました。これにより、2 回目のイテレーション後でもゲームは完全にプレイできなくなりました。
この問題はあと 2 ~ 3 回のプロンプトで解決できると確信しています。また、DeepSeek の低価格設定を考えると、10 回以上のデバッグ ラウンドを行っても、Opus 4.5 の試行成功は 1 回未満で済みます。
# 概要: GPT-5.2 vs Opus 4.5 vs DeepSeek 3.2
// コストの内訳
3 つのモデルのコスト比較は次のとおりです。
$0.27 $1.10
$1.75 $14.00
$5.00 $25.00
$21.00 $84.00
DeepSeek V3.2 は最も安価な代替品であり、モデルの重みを無料でダウンロードして独自のインフラストラクチャで実行することもできます。
GPT-5.2 は DeepSeek V3.2 のほぼ 7 倍高価で、次に Opus 4.5、GPT-5.2 Pro が続きます。
この特定のタスク (テトリス ゲームの構築) では、約 1,000 の入力トークンと 3,500 の出力トークンを消費しました。
追加の反復ごとに、追加ラウンドごとに追加の 1,500 トークンが見積もられます。モデルごとに発生する合計コストは次のとおりです。
~$0.005 ゲームはプレイできません
~$0.07 プレイ可能だが、ユーザー エクスペリエンスが低い
~$0.09 プレイ可能で優れたユーザー エクスペリエンス
~$0.41 プレイ可能だが、ユーザー エクスペリエンスが低い
# テイクアウト
このゲームを作成した私の経験に基づいて、 日々のコーディング作業では Opus 4.5 モデルを使い続けるでしょう。
GPT-5.2 は Opus 4.5 よりも安価ですが、同じ結果を得るために必要な反復で同じ金額が費やされる可能性が高いため、私は個人的にはコーディングには使用しません。
ただし、DeepSeek V3.2 は、このリストにある他のモデルよりもはるかに手頃な価格です。
予算に余裕があり、デバッグに時間の余裕がある開発者であれば、コードを動作させるのに 10 回以上の試行が必要な場合でも、最終的には費用を節約できます。
欠陥のあるコードを思いつくまでに考えるのに約 6 分かかったので、GPT 5.2 Pro が最初の試行で動作するゲームを作成できないことに驚きました。結局のところ、これは OpenAI の主力モデルであり、テトリスは比較的簡単なタスクであるはずです。
ただし、GPT-5.2 Pro の強みは数学と科学の研究にあり、特にトレーニング データからのパターン認識に依存しない問題向けに設計されています。おそらく、このモデルは単純な日常のコーディング作業用に過剰に設計されており、代わりに、複雑で新しいアーキテクチャを必要とするものを構築するときに使用する必要があります。
この実験から得られる実際的なポイントは次のとおりです。
- Opus 4.5 は、日常のコーディング作業で最高のパフォーマンスを発揮します。
- DeepSeek V3.2 は、適切な出力を提供する低予算の代替品ですが、目的の結果を達成するにはある程度のデバッグ作業が必要です。
- GPT-5.2 (スタンダード) は Opus 4.5 ほどパフォーマンスが良くありませんでしたが、GPT-5.2 (プロ) はおそらく、このような簡単なコーディング タスクよりも複雑な推論に適しています。
上で共有したプロンプトを使用してこのテストを自由に再現してください。コーディングを楽しんでください。
 
 
#ChatGPTClaudeDeepSeek #にテトリスの構築を依頼しました