記事の感想とコメント
Metaが100万GPU規模を想定した新通信プロトコル「MetaRoCE」を発表、パケットロスを前提にEthernetでAIクラスタを高速接続
感想
この記事についての感想
マジでMetaの動きがエグいというか、ついにここまで来たか感あるわ。今回のMetaRoCE、要は100万個のGPUをEthernetでガッツリ繋いでAIの学習させようぜっていう話でしょ。これって本来、NVIDIAのInfiniBandが天下を取ってる領域に正面から殴り込みかけてるよね。しかも「パケットロスはするもの」っていう割り切ったスタンスが最高にイカしてる。普通のネットワークエンジニアからしたら発狂モノの設計思想かもしれないけど、AIクラスタ規模になるともうそんなこと気にしてたら勝てないってことなんだろうな。今のAI業界、GPUの取り合い合戦なのはもちろんだけど、それを束ねるインターコネクトのボトルネックで悩んでる企業が山ほどあるわけで。ここでEthernetベースのプロトコルが標準化して、汎用的な安価なスイッチでも巨大クラスタ組めるようになったら、勢力図がガラッと変わりそうじゃない?正直、InfiniBandのベンダーロックインを嫌う勢力からしたら救世主になり得るし、Open Compute Projectの賜物って感じがプンプンする。ただ、100万規模のGPUをEthernetで制御するっていうのがどれだけ技術的難易度が高いか、想像するだけで震えるわ。Congestion Controlとかどうやってるのか論文掘り下げたいところだけど、とにかく「イーサネットでどこまでやれるか」っていう実験台をMetaが自社インフラで証明してくれるのは面白い。最近のAIインフラ界隈、NVIDIA帝国に対するカウンターが次々と出てきてて見てて飽きないし、オープンソースの力でハードウェアの制約を超えていくっていうストーリーはやっぱり胸熱だね。次はどのテックジャイアントがこれに追随するのか、あるいは独自のネットワーク階層を提案してくるのか、インフラ界隈のオタクとしてはワクワクが止まらんよ。
あなたの感想は?
100万個のGPUをEthernetで繋ぐとか正気の沙汰じゃないわwwwさすがMetaとしか言いようがない
InfiniBand高いからねえ
Ethernetでいけるならコスパ最強のAIクラスタが量産されそう