過去5年間、生成AIが市場を席巻し、ユーザーのプロンプトに基づいてテキストや動的な動画など様々なコンテンツを作成してきました。現在、企業に根本的な変革をもたらすと期待されているのがエージェンティックAIです。エージェンティックAIはユーザーのプロンプトに応答するだけでなく、推論、計画、マルチステップ操作の実行を通じて目標を達成し、ほとんど人間の介入を必要としません。
Gartner社は、2028年までに日常業務の意思決定の少なくとも15%がエージェンティックAIによって自律的に行われると予測しています。またGartnerは、2027年末までに企業がエージェンティックAIプロジェクトの40%以上を中止すると指摘しています。なぜエージェンティックAIがそれほど重要であるにもかかわらず、企業はAIを業務に組み込むのに苦労しているのでしょうか?Gartnerは、最大の障壁はコストの上昇とAIエージェントの大規模展開の複雑さであると考えています。
エージェンティックAIの成功を確実にするために、企業はGPUとCPUの比率を適切に確保する必要があります。「GPUアイドル税」は、ユーザーがAIを拡張する際にますます懸念される問題であり、GPUが十分に活用されずに費用が発生し続ける隠れたコストを指します。数万のクラスターからのデータに基づき、Cast AIはGPU利用率がわずか5%であると報告しています。GPUのアイドル時間は通常、企業がリソースを節約するために意図的に行うものではなく、アーキテクチャの不均衡である可能性が非常に高いです。Intelとジョージア工科大学の共同研究プロジェクトでは、エージェントワークロードにおいて、CPU上のツール処理が全レイテンシの50%から90%を占めることが判明しました。GPUはCPUが作業を完了するのを待ってから次のトークンバッチを処理するため、アイドル状態になり、運用コストが増加します。
AIの状況が変化し進化し続ける中、企業はCPUとGPUが連携し、適切な比率を維持する必要があります。これにより優れたパフォーマンスが実現され、AIインフラに過剰な費用を支払うことを防げます。
生成AIとエージェンティックAI
生成AIとエージェンティックAIは、ワークフローが周囲のシステムとどのように相互作用するかにおいて根本的に異なります。生成AIは通常、比較的孤立したインフラで動作します。入力プロンプトを受け取り、事前学習済みモデルで処理し、出力を返します。通常、他のシステムとの深いリアルタイム統合は必要ありません。そのワークフローは大部分が自己完結型であり、静的な学習データに依存し、せいぜい厳選された知識ベースからの限定的な検索を行うだけです。
対照的に、エージェンティックAIは目標を達成するために自律的に行動でき、組織のインフラ全体の複数のコンポーネント間での継続的な通信が必要です。これらのシステムは、操作を調整し、リアルタイムデータベースにクエリを実行し、APIと対話し、ワークフローをトリガーし、さまざまなサービスのフィードバックに基づいて動的に調整できなければなりません。したがって、エージェンティックAIは、データ、ツール、意思決定層が相互接続され、緊密に統合され、相互運用可能な環境に依存しており、そのワークフローは本質的に、生成AIの比較的孤立したプロセスよりも複雑で分散しています。

CPUとGPUのバランス
過去5年間のAIブームにおいて、GPUは計算の中核でした。しかし、GPUはエージェントシステムを定義する多様な行動(リアルタイムネットワークデータの取得、自動運転用のカメラやLiDARなどの連続センサーストリームの処理、タスク完了のためのeコマースプラットフォームのような複雑なインターフェースの操作など)を処理するようには設計されていません。これらの点で、CPUは重要な補完的役割を果たし、GPUに欠けている汎用計算、制御フロー、システムレベルの調整を実現します。エージェンティックAI、特に企業の業務自動化が進むにつれて、CPU駆動のプロセスは、より広範なプロセスのオーケストレーション、ツールの調整、メモリと状態の管理、外部システムとの対話においてますます中心的な位置を占めるようになっています。
ワークロードの観点から見ると、この変化はCPUとGPUの利用率に微妙なバランスをもたらします。従来の生成AIプロセスはほとんどの時間をGPUで実行し、CPUは比較的軽量な前処理とリクエスト管理のみを処理します。対照的に、エージェントワークロードは、ツール呼び出し、意思決定ループ、I/O集中型操作を頻繁に実行するため、実行時間の大部分(多くの場合支配的)をCPUで費やし、GPUの使用はモデル推論中の短いバーストに限られます。この不均衡はサービス環境で特に顕著であり、CPUの並列処理は柔軟ですが、GPUほど拡張性が高くないため、ツールに大きく依存するエージェントワークロードは、GPUが十分に活用される前にCPUリソースを飽和させる可能性があります。高いGPU利用率を維持しボトルネックを回避するために、エージェンティックAIシステムは、タスクオーケストレーションのニーズを満たす十分なコアとスレッドを備えた高性能CPUを必要とします。現代のデータセンターでは、GPUとCPUの数を適切に構成することが重要であり、そうでなければ、十分なCPU計算能力を持たない施設は高価なGPUリソースをアイドル状態にし、システムパフォーマンスと投資収益率を低下させます。
CPU中心のアプローチ
「エージェンティックAI実行の理解、分析、最適化に向けて:CPU中心の視点」と題された論文で、Intelの研究者とジョージア工科大学のパートナーは、エージェンティックAIワークロードによって引き起こされるシステムボトルネックを説明、分析し、特に処理におけるCPUの中心的な役割を強調しました。
このため、研究者は異なるハードウェアシステムでランタイム特性分析を実施し、エンドツーエンドのレイテンシ、バッチスループット、エネルギー消費分析に焦点を当て、システム内のハードウェアボトルネックを特定しました。チームは、広く展開されている5つのエージェンティックAIワークロードを特定しテストしました。これらのワークロードには、事実に基づく質問応答、コーディング、科学タスクなどの幅広いアプリケーションが含まれ、多様なモデルサイズ、オーケストレーションパターン、ツール統合戦略を代表しています。以下の図は、これら5つのワークロードがCPUとGPUでそれぞれ費やした平均処理時間の割合を示しています。

結果は、ツール主体のエージェンティックAIワークロードがCPU上のツール処理によって深刻に制約され、CPUタスクがエンドツーエンドのレイテンシの平均86%を消費することを示しています。これらの結果は、ほとんどのユースケースにおいて、企業は積極的にCPU中心の最適化戦略を実施すべきであることを示唆しています。ただし、CPUとGPUの処理時間の具体的な割合は、Toolformerが数学拡張タスクで17%のCPU時間を費やすことから、LangChainが質問応答タスクで最大86%のCPU時間を費やすことまで、大きく異なります。したがって、企業にとって最も効率的なCPU:GPU比率を決定する際には、具体的なユースケースを考慮することが重要です。
上昇するCPU:GPU比率
Intelのホワイトペーパー「エージェンティックAIにはより多くのCPUが必要」では、CPU計算能力を増やすことでシステムボトルネックを緩和し、GPU計算の飽和を維持してコストを削減する方法が検討されています。チームが構築したあるプロセスの結果は、CPUがプロセス全体の大部分の時間を消費し、「コンテキストの補完」ステップにLLM推論時間の3倍の時間がかかることを示しました。研究者はまた、開発者がAIアシスタントにコードの作成とテストを依頼するシナリオを模した2番目のベンチマークを構築しました。このベンチマークでは、コード生成(GPU)が62.8秒で完了したのに対し、CPUでの実行は64.1秒を消費し、CPUがプロセスの制限要因となりました。
このホワイトペーパーのテストによると、研究者は現在の世代の展開では、約0.8:1から1.4:1の(CPU対GPU)比率を維持することで、GPUの十分な活用が確保されることを発見しました。ただし、前述の通り、これはワークロードとハードウェアに大きく依存します。以下の図は、モデルサイズが推奨比率にどのように影響するかを示しています。

この図は、モデルが小さく効率的であるほど、同じパフォーマンスを維持するためにより多くのCPUが必要であることを示しています。さらに、このホワイトペーパーは、GPUの性能向上がCPUの改善を上回り続けるにつれて、この比率は大幅に上昇する必要があり、ワークロードの種類と複雑さに応じて、将来のシナリオでは最大7:1になる可能性があると指摘しています。この研究は、CPUが次世代エージェンティックAIシステムのパフォーマンスとコスト効率を実現する上で中心的な役割を果たすことを強く証明しています。
Intel Xeonプロセッサ、エージェンティックAIのために
CPUは、オーケストレーション、データ移行、推論、システムレベルの調整を処理し、AI技術スタック全体の基盤となります。したがって、ますます複雑でハイブリッドなAI環境で一貫したパフォーマンスを確保するには、適切なCPUを選択することが重要です。Intel Xeon 6プロセッサは、内蔵AIアクセラレーション、インフラの一貫性、セキュリティ保証を組み合わせ、最新のAIインフラに強固な基盤を提供します。
- 内蔵アクセラレーション:Intel Xeonプロセッサは、企業が既存のアーキテクチャ上で直接推論を実行し、価値実現を加速し、特定のスキルへの依存を減らすことを可能にし、これがXeonを際立たせています。Intel AMXやIntel AVXなどの内蔵AIアクセラレータにより、Xeonは一般的な推論ワークロードで強力なパフォーマンスを提供し、競合他社と比較して少ないコアで最大50%の性能向上を実現します。この統合されたアクセラレーション、拡張性、運用の柔軟性の組み合わせにより、Xeonは企業AIの強固な基盤となります。
- インフラの一貫性:Intel Xeon 6プロセッサは、世界で最も広く展開されている汎用CPUです。企業のAI運用が拡大し統合が進むにつれて、Xeonはインフラの一貫性を確保できます。これらのプロセッサは最大192のPCIe 5.0レーンをサポートし、I/O帯域幅、拡張性、アーキテクチャの柔軟性を向上させます。推論ワークロードと同様に、汎用サーバーもIntel Xeon 6 CPUの恩恵を受け、MCRDIMMによるメモリ帯域幅の向上や、CXL 2.0サポートによるメモリ拡張が可能です。業界をリードするRAS機能はAIクラスターの安定性維持に役立ち、高いシングルスレッド性能はオーケストレーションやスケジューリングなどのタスクを加速し、P99およびテールレイテンシを低減します。これはユーザー向けAIサービスにとって重要です。
- AI対応の安定性と信頼性:安定性と信頼性はAIアプリケーションの基盤であり、企業はモデルとデータを保護する信頼できるインフラを必要とします。Intelの技術は、強力な製品の安定性と信頼性の保証で広く認知されており、ファームウェアの脆弱性の約96%は積極的な内部防御によって発見されていますが、他の同様のプラットフォームではその割合は57%に過ぎません。さらに、Intelは業界で最も包括的な機密コンピューティング製品ポートフォリオの1つを有しており、異種AI環境で堅牢なエンタープライズグレードのCPUアーキテクチャを構築しようとする組織にとって、Xeon 6は理想的な選択肢です。
AIワークロードがより動的で分散化され、エンタープライズシステムと緊密に統合される時代において、インフラの意思決定はパフォーマンス、拡張性、信頼性のバランスを取る必要があります。Intel Xeonプロセッサはこれらの要素を統合し、効率的な推論のための内蔵アクセラレーション、拡大する展開をサポートする一貫性と拡張性のあるプラットフォーム、重要なデータとモデルに対する強力な保護機能を提供し、現代のAIの進化するニーズに適合します。これらの機能を広く採用された統一アーキテクチャ内に集約することで、Xeonは顧客が運用を簡素化しながら、AIユースケースの拡大に継続的に柔軟性を提供できるようにします。
