주메뉴바로가기본문바로가기
비즈한국 비즈한국

「AIはまだ半導体に飢えている」AMDヘリオスから見るコンピューティングの未来

この記事はAIによって自動翻訳されました。原文(韓国語)と異なる部分がある場合があります。  Read original in Korean →

[비즈한국]  再びAI懐疑論が浮上しています。「AIが役に立たない」というわけではなく、「AIは期待していたほどの多額の投資に見合う価値はないのではないか」という、産業的観点から時折繰り返される懸念の視線です。どのような結論が出るにせよ、私たちがAI技術の可能性を疑ったり、AIの使用量を減らしたりすることはないでしょう。当面は、むしろさらに増えていくはずです。

現在、AI関連企業がコンピュータに注ぎ込んでいる投資は想像を絶するレベルです。最近のGoogleの決算発表を見ると、2026年の設備投資額は2000億ドル規模に達すると見込まれています。Googleは直近の四半期で1200億ドル規模の売上を達成し、前年同期比で24%成長しました。Googleクラスの企業がこれほど成長するのは驚異的なことです。その中でもクラウド事業は前年同期比で82%も収益を伸ばしました。理由はただ一つ、AIに他なりません。

莫大な性能を発揮するコンピュータの需要が急激に高まっています。写真=チェ・ホソプ提供

しかし皮肉なことに、この発表以降、株式市場は唐突にAI懐疑論を持ち出しています。Googleが期待以上の実績を上げ、強力な成長エンジンを得たのは事実ですが、それに対して設備投資の割合が高すぎるという理由からです。見方によって異なりますが、最近の半導体をはじめとするAI主導企業に対する評価は、一瞬にして冷え込んでいます。少々恐怖を感じるほどです。

依然としてAIは、現在の産業を牽引する核心的なキーワードです。Googleをはじめとするハイパースケーラーと呼ばれる企業は、莫大な収益を上げています。そして、より優れたモデルを作るためにAI関連インフラをさらに拡充しています。事実上、世界のほぼすべてのコンピューティングリソースをかき集めているのです。かつてないほどインフラの成長には本気であり、恐ろしいほどの集約と拡張が続いています。

「コスト当たりのトークン生成」を高めるための技術的渇望

先日、米サンフランシスコで開催されたAMDの年次AIイベント「Advancing AI」に参加してきました。AMDのAI関連新製品を紹介し、大きな戦略とロードマップを発表する場です。これまでこのイベントは、AIを処理するGPU、そしてそれをAIに活用するためのROCm開発フレームワークを中心に展開されてきました。なぜなら、世界のAIはNVIDIAのCUDAフレームワークを基盤として始まり、それを駆動するNVIDIAのGPUで運営されてきたからです。

AMDにとって、「AMDのGPUも素晴らしい性能を発揮し、ROCmもNVIDIA CUDAに劣らず簡単で強力なAI環境を作れる」という点を強調するのは当然のことでした。特にNVIDIAのGPUは爆発的な需要に対して供給が追いついていなかったため、最も強力で現実的な代替案として「Instinct」をはじめとするAMDのGPUを提示するのは自然な流れです。

推論への需要が大きく高まる中、「コスト当たりのトークン生成」の効率性が主要な課題として浮上しています。写真=チェ・ホソプ提供

しかし今年のAMDのスタンスは微妙に変化しました。単純なNVIDIAの代替品としてではなく、現在最もホットなキーワードである「コスト当たりの性能」、「コスト当たりの生成トークン数」といった現実的な回答を打ち出したのです。主要なAIモデルの基本的な学習はすでに定着し、学習のためのインフラ性能はある程度余裕が出てきました。しかし、今最も現実的な問題は、利用者の要求に合わせて回答を導き出す「推論」にあります。

AMDのCEO、リサ・スー氏は基調講演で「2年前まで学習と推論の比率は6:4程度でしたが、今年を起点に逆転が起きています」と明かしました。現場でのAI要求量が爆発的に増えているということです。今や大規模言語モデルは単なる文章作成を超え、大規模な開発プロジェクトのコードを書き、科学実験を分析し、画像や動画を生成します。情報を検索・整理し、自然な文章を書くのは当然のことです。しかし、それを処理するのは結局、各サービスを構成するコンピュータの推論能力にかかっています。

エージェントAIは複数のAIモデルを通じて回答を導き出すため、より大きなコンピューティングパワーを必要とします。写真=チェ・ホソプ提供

さらに、AIはそれぞれが単独で仕事をする段階から、特定の分野に最適化された複数のAIが組み合わさって一つの大きなタスクを処理する「エージェントAI」へと流れが移行しています。一つのタスクを処理するために、より多くのAIモデルを稼働させなければならないのです。

AMDは今年、単にGPUをリリースするだけでなく、CPUとGPU、そしてそれらのサーバー18台を束ねるネットワーク環境を統合したAIスーパーコンピュータ「Helios(ヘリオス)」を発表しました。単にこのコンピュータが優れているという話ではなく、このコンピュータが追求する方向性が現在のAIの現実をそのまま反映している点に注目する必要があるため、ここで取り上げました。

このコンピュータの核心は、データセンターに入る薄型のブレードサーバーを束ねることにあります。各トレイに搭載されるサーバーは、1チップあたり256コアを搭載したEPYCプロセッサと、Instinct MI455Xと呼ばれる高性能GPU 4基が組み合わさります。これらのGPUは432GBという膨大な量のHBM4メモリとペアになります。この単位ブレードを18台束ねて、冷蔵庫ほどのサイズのラックシステムを構成します。つまり、実に4608個のコア、72個のGPU、31TB(テラバイト)のHBMが一つにまとめられたシステムなのです。

「ラックスケールシステム」、同じ空間でより多くのコンピューティングパワーを確保する手法

Heliosもまた、よくデータセンターで見かけるタイプのコンピュータですが、何が特別なのでしょうか?実のところ、AIをはじめとする現代のコンピュータにとって、単純な処理速度よりも「全体的なスループット(処理能力)」が重要な基準となります。どれだけ多くの計算を一度にこなせるか、ということです。そのため、一つのシステム、つまり制限された空間の中にいかに多くのコンピュータを詰め込めるかが鍵となります。これは単に数を増やせばいいという問題ではありません。サーバーも非常に高度に見えますが、私たちが使うPCと構造はそれほど変わりません。CPUとメモリが中心となり、そこにGPUをつなぐのは同じです。

PCのようにグラフィックカード形式のGPUを挿す方式は基本ですが限界があるため、規模が大きくなると他の手法が必要になります。写真=チェ・ホソプ提供

特にGPUはPCI Expressと呼ばれる端子を通じてデータをやり取りしますが、この経路を通るデータの速度と量には限界があります。そのため、AIを処理するためにコンピュータ一台にGPUを2基挿しても、正確に2倍の仕事をするわけではなく、わずかなロスが発生します。かつてはコンピュータ一台に多くのGPUを挿すこともありましたが、GPUが増えるほどそのロスは拡大します。さらに、コンピュータ一台に挿せるGPUの数は、PCI Expressだけでなくスペースの制限もあります。そこで、単位サーバーを複数束ねて一つのシステムを作ります。通常、これを構成する本棚のような「ラック」はこのように作られます。

しかし、サーバーとサーバーを束ねると、より大きなロスが生じます。サーバー内では基板上での処理で済みますが、サーバー間を接続すると、一つのコンピュータ内で処理した結果を再びネットワークへ転送しなければなりません。基本的に転送量、そして物理的にデータが移動するのにかかる時間など、さまざまな理由で性能ロスが劇的に増大します。100基のGPUを束ねても、100倍の性能どころか50倍出すことさえ難しいと言われるほどです。

しかし、これで終わりではありません。AIの処理量が増えるにつれ膨大な数のGPUが求められ、このラックをさらに数十、数百個つなぐデータセンターが構築されます。データセンターは限られた空間により多くのコンピュータを入れることを目的としています。CPUやGPUを詰め込むのと同じくらい、接続の効率性を高めなければなりません。

Heliosは18台のサーバーで4600個余りのCPUコア、72基のGPU、31TBのHBM4メモリを束ねます。写真=チェ・ホソプ提供

AMDがHeliosを通じてCPUとGPUを「単品」で売るのではなく、システム型の「完成品」としてパッケージ化した理由も、この接続に関する普遍的な標準を提案するためです。256コアCPU一つにGPU 4基を組み合わせた時に最適な性能を発揮し、ボトルネックなしで接続できるようにするのです。このように標準化されたシステムを複数連結すれば、データセンターを安定的に運用する上でも有利です。

これはすでにNVIDIAも「Vera Rubin」を通じて提示しているコンセプトでもあります。GPUをより高く売るためにプラットフォームを独占し、完成品として販売していると解釈することもできますが、データセンターの限られた空間に最も効率的かつ安定的にコンピューティングパワーを集約する方法であるため、今すぐインフラを確保しなければならない状況においては、はるかに有利な手段です。

実際にAMDはHeliosを通じて、一つのラックに以前よりもはるかに多くのHBM4メモリを詰め込みました。リサ・スーCEOは、今後のAI環境がより多くのメモリを必要とすることは必然であるため、可能な限り多くのHBMメモリを同じ空間内に確保することが、市場にとって最も緊急の課題だと述べています。

限られた空間により多くのコンピューティングパワーを集約することは常にデータセンターの課題でしたが、その規模や難しさは以前とは比較になりません。写真=チェ・ホソプ提供

まだメモリに飢えているエージェントAI

これまでの大規模言語モデルは「チャットボット」の形態が中心でしたが、これからはエージェントAIの時代が開幕し、各エージェントはより多くの推論を必要とし、その結果を集めて価値を生み出す「オーケストレーション」が重要になります。これに伴い、推論性能だけでなく、記憶しておくべきメモリの量も増大していくということです。

AIはさらに大きなコンピューティングパワー、より多くのメモリを要求するようになります。これまでも私たちはPCやスマートフォンに必要なプロセッサやメモリなどの限られたリソースをAIに譲ってきました。その対価は、驚くほど高騰した半導体価格となって返ってきています。しかし今のAI市場は、それ以上のリソースを吸い上げています。AMDのHeliosやNVIDIAのVera Rubinは、それに対する技術的に魅力的な提案なのです。

Anthropicの共同創業者トム・ブラウン氏は、AMDとのパートナーシップに対する大きな期待を語りました。AMDはAnthropicに対して、実質的に莫大なハードウェアベースの投資を行ったと言えます。写真=チェ・ホソプ提供

AMDは「Advancing AI」の基調講演直前、Microsoft、そしてAnthropicとのパートナーシップおよび投資計画を発表しました。特に「Claude」を提供するAnthropicには50億ドル、日本円で約7500億円を超える莫大な規模の戦略的投資を行うことになり、Anthropicはこれを基に、来年までに1ギガワット規模のHeliosベースのAIインフラを導入することにしました。このインフラ導入費用は正確には不明ですが、膨大なコストがかかることは間違いありません。AnthropicはこれのためにAMDに株式の一部を譲渡する形でリソースを確保したと解釈できます。AMDにとっても、目先の売上よりハードウェアを通じて実質的に現物でAnthropicの株式を確保する戦略なのです。最近、NVIDIAがNAVERに投資を行い、同時にVera Rubinシステムを供給するのも、これと似た流れとして読むことができます。

これは、AIが現在よりもはるかに多くの半導体を要求しており、多少負担が大きくても次世代のGPUとメモリを早急に吸い上げざるを得ないことを証明しています。AI業界は今後も、さらなるリソースを吸い上げる準備を進めています。現在の機械学習ベースのAIは、結局のところ熾烈な「確率」の戦いであり、基本的なモデル生成と運営の方法は確立されました。AIの技術的限界に達しつつあるという解釈も間違いではないでしょう。今の単一モデルでは、これ以上賢くなるのが難しいということです。

しかしエージェントAIはこれを克服し、AIにさらなる仕事を信頼して任せられるようにする新しい手法です。エージェントAIは、これまでとは異なる環境を創り出します。その長い旅の終着点は、40年前に初めて提案された機械学習技術である「人工知能」の完成となるでしょう。そしてその過程で、私たちは今よりもさらに多くの半導体という対価を支払うことになるはずです。

この記事はAIによって自動翻訳されました。原文(韓国語)と異なる部分がある場合があります。
최호섭 IT칼럼니스트
writer@bizhankook.com
저작권자 ⓒ 비즈한국 무단전재 및 재배포 금지