コンテンツに移動
デベロッパー

AI トークノミクス ガイド: トークン効率の高いソフトウェア エンジニアリングのための 11 の原則

2026年7月27日
https://storage.googleapis.com/gweb-cloudblog-publish/images/4_Steampunk_AI_Tokenomics_Header.max-1600x1600.jpg
Alex "Sandu" Astrum

Developer Relations, Antigravity

Luke Schlangen

Developer Advocate, Google Cloud

※この投稿は米国時間 2026 年 7 月 18 日に、Google Cloud blog に投稿されたものの抄訳です。

AI コーディング アシスタントの動作を高速かつ正確に保つには、トークンの使用量を最適化することが重要です。以前のように手動でコードを 1 行ずつ記述することはなくなるかもしれませんが、今後は、各トークンを最大限に活用できるよう、コーディング アシスタントを導くことが必要になります。コンテキストが肥大化すると、レイテンシが増加し、モデルが指示を忘れたり、ハルシネーションを起こしたりするだけでなく、費用もかかり、人間が実際に重要な問題に注意を払いにくくなります。習慣を構造化することで、迅速、正確で、生産性の高いフィードバック ループを維持できます。

1. バランスの取れたモデルから始める

どのモデルがよいかわからない場合は、デフォルトの Gemini 3.5 Flash中程度の推論)から始めます。複雑さを測定しながら進めます。タスクが失敗した場合、ホップ数が多すぎると思われる場合、または複雑な設計が必要な場合は、より大規模なモデルやより高度な推論にスケールアップします。

2. 最初からスキルを使用する

プロンプトごとにワークフロー、テストルール、環境を説明する必要はありません。スキルについて周囲の人に尋ねたり、オンラインで検索したりするか、SKILL.md ファイルとスクリプトを使用して、独自の再利用可能なスキルをパッケージ化することもできます。エージェントはこれらのスキルを自動的にトリガーするため、プロンプトが簡潔に保たれ、オンライン ドキュメントを不必要に検索したり、ローカルコードや環境を調べたりする必要がありません。

3. スクリプトと CLI ツールで自動化する

多数のファイルの書式設定やログデータの抽出など、繰り返しの多い雑務については、エージェントに単純なローカルツールを作成させます。セットアップ、lint チェック、テストには公式の CLI ツールを使用します。コードを記述する前に、読み取り専用コマンドを実行してコードベースを調査し、長い試行錯誤のループを回避します。

4. 出力の多いタスクを委任する

詳細な調査や、フロントエンドとバックエンドの作業の分離など、出力の多いタスクをサブエージェントに委任します。作業が完了したら、完全な軌跡ではなく最終結果のみを調整します。

5. 分割統治法を使う

David Rensin は、「Elephants, Goldfish and the New Golden Age of Software Engineering」で、高度な推論と長いコンテキストのセッション(「Elephant」)を使用して詳細な実行プラン(「Goldfish」)を生成する方法を説明しています。そのプランを、トークン数の少ないクリーンなセッションで実行します。コンテキスト ウィンドウがいっぱいになったときにクリーンな状態から再開できるように、commit やアーティファクトを使用して頻繁に進行状況をチェックポイントに保存します。

6. 検証をシフトレフトする

テストを早期に自動化します。UI テストを行う前に、ローカルビルドと、単体テストおよび機能テストを実行します。ハンドオフの直前に、ブラウザで費用のかかるスモークテストを実行するようにエージェントに指示します。費用のかかる検証ループは、マイルストーンの最後に実行します。

7. ドリフトが発生したら元に戻す

エージェントがドリフトし、その修正方法がわかっている場合は、軌跡スレッドの元に戻すボタンを使用するか、ファイルを元に戻します。壊れた状態の上に修正プロンプトを積み重ねないでください。コンテキストが汚染されます。

8. コンテキストを具体的に示す

細かく指示するのではなく、具体的に指示します。文法的に正確で曖昧なリクエストよりも、スペルミスがいくつかある明確な指示の方が優れています。同様に、1 万件のログを対象とした、条件が不十分な検索をエージェントに指示するのではなく、対象のファイル、セクション、エラーを正確に指定する(// SHOULD BE X, NOT Y, FIX THIS のような明確なアノテーションを付ける)ことで、大きな効果が得られます。可能な場合は、インライン コメントを使用します。これにより、エージェントは修正が必要な場所を正確に把握できます。

9. ルールを反復修正する

エージェントの動作を修正し続ける場合は、AGENTS.md でグローバル ルールを更新するか、スキルを編集します。エージェントに繰り返しプロンプトを送信するのではなく、指示を修正して、変更が永続的に適用されるようにします。

10. 制御されていないループを回避する

保留中の作業がないかプロジェクトをスキャンするスーパーバイザー ループは、最適化の余地を見つけることができますが、トークン予算全体を簡単に使い果たしてしまう可能性があります。ループを実行する場合は、厳格な制限と停止条件を設定します。自律性の高いエージェントには、厳格なガードレールと優れた評価が必要になります。エージェントがループ内でステータスをポーリングしないようにします。イベント ドリブン ウェイクアップを使用します。

11. 新しいトピックごとに新しいセッションを開始する

同じトピックについて続けて話す場合は、同じチャットを使用すると、エージェントが既存のコンテキストを再利用できますが、トピックを変更する場合は、新しいチャットを開始してください。エージェントは、必要なコンテキストのみを取り込むことで、より少ないトークンでより良い回答を提供できるようになります。

優先順位を付けて予算を賢く使う

トークンは無限ではありません。LLM の呼び出しの背後には、出力を生成するための作業を行う実際の物理マシンがあります。対象のプロジェクトや機能に優先順位を付けます。

トークンを最適化するには、AI の注意を適切な方向に向けることが重要です。階層化されたアプローチを使用することで、開発を迅速に進め、精度の高い出力を保ちながら、支出を最適化できます。上述の 11 の原則が、AI セッションにおける人間の介入と自動化の適切なバランスを見つけるためのヒントになれば幸いです。

- Antigravity、デベロッパーリレーションズ、Alex "Sandu" Astrum

- Google Cloud、デベロッパー アドボケイト、Luke Schlangen

投稿先