日本語版
最新ニュース
世界

AI API コストをほぼ半分に削減する 7 つの方法

私はついに Molty を試してみなければなりませんでした。Molty は、ここ 1 週間ほどオンラインで話題になっている、大々的に宣伝されている常時接続 (永続的) チャット ボットです。 すべてが期待どおりに機能しました。をセットアップしました ヘッツナー VPS 月額約 10 ドルで、IPE で Claude Code を使用してインストールしました (これが何を意味するかについては、IDE から IPE への説明を参照してください)。 オープンクロー 次に、Molty を起動できるように、私のアカウントに接続された Anthropic API トークンを入力しました。 私がすぐに学んだことの 1 つは、API 呼び出しは非常に高価であるということです。私の通常の Claude Max プラン (月額 100…

AI API コストをほぼ半分に削減する 7 つの方法

1771797637
2026-02-22 21:53:00

私はついに Molty を試してみなければなりませんでした。Molty は、ここ 1 週間ほどオンラインで話題になっている、大々的に宣伝されている常時接続 (永続的) チャット ボットです。

すべてが期待どおりに機能しました。をセットアップしました ヘッツナー VPS 月額約 10 ドルで、IPE で Claude Code を使用してインストールしました (これが何を意味するかについては、IDE から IPE への説明を参照してください)。 オープンクロー 次に、Molty を起動できるように、私のアカウントに接続された Anthropic API トークンを入力しました。

私がすぐに学んだことの 1 つは、API 呼び出しは非常に高価であるということです。私の通常の Claude Max プラン (月額 100 ドル) を利用するのと比較して、トークンを異常な速度で消費しているように見えました。そこで、ロニ・スタークと私は、ロニがサード・マインドAIサミットで初めて探求した概念であるトークン・エコノミクスについてすぐに詳しく知りたいと思いました。

AI API トークンの支出を最適化する方法

1. 業務に適したモデルを選択する

これはおそらく、知っておく必要がある最も重要な要素です。フロンティアモデルが最も高価です。 GPT-5.3-Codex のような LLM (OpenAI)、Opus (Anthropic)、Gemini (Google) は特によく知られており、大規模な技術的で複雑な問題やコーディング プロジェクトの解決に一般的に効果的であることが証明されています。ただし、その推論にはすべて大規模なコンピューティングが必要です。誰かが代償を支払わなければなりません。企業が初期の段階で先頭に立って競争しようとしているため、サブスクリプションと API の価格設定には多額の補助金が提供されていると私は信じています (純粋な直感ですが) が、それでも厳しい目に遭う可能性があります。

Anthropic を例として使用してみましょう。これは、私が通常の IPE (Cursor、VS Code、および Claude Code Extension を備えた Google VM) で使用しているものであり、今回は Molty でも使用します。次の 3 つのモデルがあります。

  • オーパス — 最も強力で、複雑な問題の解決に適しています (5x Haiku)
  • ソネット — 一般的な推論に基づいてバランスが取れています (3x Haiku)
  • 俳句 — 基本的なタスク用の低コスト オプション (1x ベースライン)

小型のピックアップトラックで十分なら、なぜ 18 輪にお金を払うのでしょうか?

内訳は次のようになります (Claude Code Opus 4.6 によって作成)。

7 つのレバー — ビフォー&アフター

トークンエコノミクスの最適化 · Mulholland IPE

レバー 前に 後 貯蓄 1. ジョブに適したモデル
すべてのオーパス
100% オーパス
MTok あたり $15/$75 (イン/アウト)
オーパス 20% / ソネット 60% / 俳句 20%
タスクの複雑さに合わせてモデルコストを最大 40 ~ 60% 削減
~$8–15/月
2. 動的モデル切り替え
人間によるその場限りの推測
手動選択
ポリシーなし、デフォルトは Opus
自動化されたポリシー
タスクのスコープ設定 → モデルの割り当て Opus へのドリフトを防止
月額約 2 ~ 4 ドル
3. ワークスペースのトリム
AGENTS.md が毎ターンロードされる
7,869バイト
(合計 21.2 KB のワークスペース)
1,639バイト
(合計ワークスペース 16.0 KB) 1 ターンあたりのトークンの数が ~1,200 減少
~1~2ドル/月
4.壊れたCronを修正する
毎日 2 つのジョブがエラーになる
どちらも失敗
フルコンテキストをロードしてクラッシュする
ベストエフォート配信
配信の問題でジョブが失敗しない 無駄なコンテキストの読み込みが不要
月額約 2 ~ 3 ドル
5. 迅速なトリミング
朝のブリーフィング cron
588文字
詳細な指示
191文字
同じ結果で、入力が減り、プロンプトが 67% 小さくなりました
~$1/月
6. 応答の簡潔さ
出力トークン = 5x 入力コスト
~400 ワードの回答
レポートが冗長だった
スタンディングオーダー:
モルティのテスト返信: 1 単語 ✓

最大 60% の出力削減
~$5~10/月
7. タスクあたりのターン数が少なくなる
各ターンで完全なコンテキストがリロードされます
HSTSチェック:2ターン
ブロッカーと回避策
バッチ操作、フェイルファスト
必要な場合にのみエスカレーションするターン数が最大 30% 減少
~$3–5/月

7 つのレバーすべてを合計した推定節約額
~$22–40/月

おすすめ: すべてのタスクとプロジェクトを確認し、それぞれに適切なモデルを選択してください。

2. 動的なモデル切り替え「ポリシー」の実装を検討する

リポジトリ全体にわたるトークン経済学のレビューに基づいて、私はクロード コードに創造性を発揮して (青天の霹靂!)、特定のタスクやプロジェクトに対して適切な評価を必要とする新しいポリシーを実装するように依頼しました。つまり、当面のタスクの範囲を絞り、適切なモデルを選択します。 WordPress の画像最適化プラグインを作成するには、おそらく Opus (コードレビュー用に Codex と組み合わせたもの) が必要ですが、単純な cron ジョブの検証やシステム管理タスクは Haiku で簡単に処理できる可能性があります。

クロードは、この簡単なレビューを必要とするいくつかのマークダウン (.md) ファイルを作成しました。さらに、Molty がクロード コード (試してみてください!) を通じて報告したことを考慮すると、クロードは、Molty が Opus で暴走してトークンを燃やしていないことも確認して、Kopia または Restic バックアップ スクリプトが WordPress データベース バックアップを Backblaze B2 にアップロードすることに成功したことを確認するなどの作業を行いました。俳句で十分に使えるかなり初歩的な内容です。

おすすめ: モデル切り替えを自動化します。

3. ワークスペースルールとマークダウンファイルをトリミングする

もう 1 つ不意を突かれた点は、クロードをガイドするために使用されるマークダウン ファイルのサイズです。最大の犯人はCLAUDE.mdでした。これは、クロードが新しいセッションの開始時にすぐに理解できるようにするために参照するベースライン ファイルです。私の場合、Stark Insider は Google VM 上の Ubuntu で実行されている LEMP スタック上の WordPress Web サイトであると説明されています。この文書では、Kopia バックアップ、cron ジョブなどについて (徹底的に) 詳細に説明します。基本的に、かつては軽快だったデフォルト ファイルが、これまでで最長の Wikipedia エントリに成長しました。これは不必要なトークンチャーンだったため、ヘアカットが必要でした。

もちろん、答えは明白です。大きなファイルを、小さな単一トピックまたは専用のファイルに分割します。

そうすることで、LLM は無関係な情報をレビューすることなく、効率的に (そしておそらくより迅速に) コンテキストを消費できるようになります。これにより、やはり正当な理由もなくトークンが消費されてしまいます。

おすすめ: 肥大化したものをトリミングし、CLAUDE.md、README、ルール、スキルなどの主要なマークダウン ファイルをリファクタリングします。

4. スクリプトと cron ジョブの失敗に注意する

クロードは、私の新しい Molty VM で失敗している cron ジョブを発見しました。ジョブがクラッシュする前に、ジョブの完全なコンテキストが読み込まれていたことがわかりました。完全にトークンの無駄。この場合、基本的なベストエフォート配信オプションを実装しました。この簡単な修正だけで、月額推定 2 ~ 3 ドルを節約できました。

大したことのようには聞こえませんが、これらすべてが合計され、物語が語られます。トークンの無駄な支出に注意してください。これは簡単な成果です。

おすすめ: 失敗した cron ジョブやスクリプトを監査します。特に、気付かない可能性のあるサイレント エラーに注意してください。彼らはトークンを大量に生産している可能性があります。

5. 迅速なトリミング。少ないほど多いとき

おそらくこれは明白ですが、自分のワークスペースを掘り下げてみると、これもまた楽勝であることに気付きました。

WordPress Web サイトにとって重要な 2 つのトピックである最近の SEO と GEO ニュースを Web で検索する朝の cron ジョブを作成しました。 Stark Insider を実行しているということは、これらすべてのことを把握し続ける必要がある (努力する) ことを意味します。そして、AI の進歩のスピードとマシン間データ (JSON、スキーマなど) の隠された世界により、私はそれがますます困難であると感じています。

cron の中心には基本的なプロンプトがありました。問題?冗長すぎました。プロンプトだけで 588 文字でした。クロードはそれを 191 文字に圧縮しました。

驚くべきことに、入力のサイズが大幅に削減された (67%) にもかかわらず、結果は同様に効果的でした。品質に影響を与えることなく、月額 1 ドル節約できます。

ヒント: この種の調査タスクを自動化するには、IPE または OpenClaw/Molty (また名前が変更されましたか?) を使用することを強くお勧めします。 postfix または選択した電子メール サーバーをセットアップし、起動します。 AI ボットがすべての面倒な作業を行って有用な情報を表示するおかげで、自分のサーバーから送信できる有用な情報の量は信じられないほどになります。

おすすめ: 大規模で派手なプロンプトは、X でのスタンドスタンドには最適ですが、最終的には逆効果のトークンの穴になります。

6. 応答の簡潔さは針を動かす可能性がある

私は、与えられたプロンプトに対してできるだけ効率的かつ簡潔に応答するよう、常設の命令を求めました。具体的には 100 単語未満。

もちろん、結果は予想通り素晴らしいものでした。結局のところ、これらは LLM であり、この種の課題に優れています。私たちは人間として、「お願いします」「ありがとう」「また会いましょう」などのフレンドリーなマナーを、礼儀として、また人間であることを表すために言いたがります。機械はすぐに仕事に取り掛かることができ、お世辞など必要ありません(ただし、クロードがいつか立ち上がって私を殺そうとしないように、私は常にクロードを大切に扱っていると言わなければなりません)。

おすすめ: AI ボットに本題に入るように指示してください (お願いします)。

7. タスクあたりのターン数が少なくなる

これを見ると、Web サイトのパフォーマンスの最適化について思い出させられます。これは、私が日々苦労していることです。

重要な原則の 1 つは、オリジン サーバーへの往復を最小限に抑えることです。ホストサーバー (starkinsider.com) と訪問者 (あなた) の間のやり取りが増えるほど、ページの読み込みにかかる時間が長くなります。これにより、ユーザー エクスペリエンスが理想的とは言えなくなり、最悪の場合、潜在的な読者が諦めて別の Web サイトに移動してしまう可能性があります。

同じ中心的な概念がここにも当てはまります。

トークンの使用量を削減するには、モデルと API エンドポイント間のラウンドトリップを必ず削減してください。

starkinsider.com でここに挙げた例は、非常に基本的なものでした。 Molty は現在、HSTS ステータスをチェックする任務を負っています。これは Google Chrome に関するもので、この投稿では詳しく説明できないため、ユーザーには HTTPS (安全なバージョンと安全でない従来の HTTP バージョン) 経由でのみサイトにアクセスしてもらいたいということです。基本的に、私たちはこのサイトを HSTS に含めるようリクエストしました。現在、実際に起こったという確認を待っているところです。 Googleは、このプロセスには数週間かかると予想しており、ステータスを確認できるフォームを用意していると述べた。

HSTS ステータス チェックは、常時接続の Molty にとって最適な仕事です。この男は定期的に訪問しています hstspreload.org 私たちが追加されたかどうかを確認します。問題は、彼がタスクを 2 つのステップに分割していたことです。代わりにそれらをバッチ化し、2 往復ではなく 1 往復だけでタスクを実行できるため、トークンの支出を節約できたため、これは不要でした。

おすすめ: できる限りバッチ処理して、ラウンドトリップを最小限に抑えます

実際にかかる費用: 使用前と使用後

結論は次のとおりです。 7 つの手段をすべて適用した結果、出力を 1 つも犠牲にすることなく、予測される月間 API 支出をほぼ半分に削減することができました。正確な数値はワークロードによって異なりますが、比率は変わりません。モデルの選択と応答の簡潔さだけで、節約の約 70% が占めます。残りはとにかくやるべき家事です。

毎月のコスト予測 — 前後

Hetzner VPS 上の Molty (OpenClaw) · 7 つのレバーすべてを適用

成分 前に 後

APIトークンの使用量
毎日の cron ジョブ
ブリーフィング、モニタリング、HSTS チェック
6~9ドル
作品、冗長、失敗
2 ~ 4 ドル
俳句、トリミング、安定
会話とチャット
WhatsApp、対話型クエリ
15 ~ 25 ドル
オーパス、最大 400 ワードの返信
6~11ドル
ソネット、
タスクの割り当て
サーバーのチェック、調査、レポート
5~8ドル
マルチターン、フルコンテキスト
2 ~ 4 ドル
バッチ化されており、ターン数が少なくなります
ハートビートと背景
キープアライブ、アイドルコンテキスト
2 ~ 4 ドル
各 ping ごとに完全なワークスペース
1 ~ 2 ドル
トリミングされたワークスペース
API小計
28~46ドル
11~21ドル

インフラストラクチャー
ヘッツナー VPS
CPX11 (2 vCPU、2 GB RAM)
$8.49
固定費
$8.49
固定費

月額総費用

$36–54
19 ~ 29 ドル

7 つの手段をすべて適用した場合の推定節約額
~45 ~ 50% 節約

マーベリックの原則

数分かけてサーバー、Cursor IDE、IPE、OpenClaw、Molty、その他お好みの AI 環境を強化することで、出力品質を損なうことなく、驚くほど大幅なコスト削減を実現できます。

それが私が学んだ教訓でした。最適化は、私たちが実装した、または展開中のスクリプトやプロジェクトに重大な影響を与えませんでした。人間として、私はかなりの要約や結論を含む大量のテキストに慣れていたと思います。実際、私たちはよく、これから伝えることを人に伝えてから、先に進んで伝えてから、包み込んでから自分が伝えたことを伝えるように言われます。なぜ機械がそれを奇妙なことに、そしてひどく非効率的であると考えるのかを知ると驚かれるかもしれません。クロードはかつて、私が「ビーチ」をしすぎていると非難しました。それは、それがまさに人間のすることだと疑っていたからです。 24時間365日常に稼働しているモルティと比較すると、彼の言うことは一理あるかもしれない。

したがって、7 つのステップまたは手段のいずれかを試して、API 支出を大幅に削減できるかどうかを確認してください。私の例がそうであったとしても、 人類特有の、原則は、OpenAI (Codex、GPT) や Google (Gemini) を含む他の LLM に適用されます。

なぜなら、フォード マーベリックだけで本当に必要なことがあるからです。

OpenClaw と Molty の実験全体について。興味深い内容でした。おそらく私が期待していたほど劇的ではありませんでした。誰もが警告していた、あの恐ろしい、制御不能になった檻の中の動物はどこにいったのでしょうか?!しかし、それは別の投稿で。

#API #コストをほぼ半分に削減する #つの方法

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。