Fireside Weekly:今週注目すべき 8 つの対話

@firesidealpha
英語1 日前 · 2026年7月25日
148K
32
3
0
71

TL;DR

今週のダイジェストでは、NVIDIA の成長予測、カスタム AI シリコンへの移行、そして Devin のようなエージェントがソフトウェアエンジニアリングをどのように変革しているかなど、主要な 8 つの技術的議論をまとめました。

時間に追われるビルダーや投資家の皆さんへ。最高のテクノロジーやビジネスに関する対談を、何時間もかけて追いかけなくても学べるように。

今週公開されたベストエピソード 8 本を 1 か所にまとめ、各記事の全文はワンクリックで読めます。毎日の解説と新しいエピソードの分析を受け取るには、Fireside Alpha を購読してください。

今週の最大の話題:

  • Jensen Huang 氏は、AI 構築が完了するまでに半導体業界はまだ 5 倍から 10 倍に成長する必要があり、バブルは「いつか、ただ今日ではない」と述べています。▶ 視聴 · 00:32:01
  • Charlie Kawwas(Broadcom 社長) 氏の顧客は、今年 1.5 GW の AI シリコンから、来年は契約済みの 6.5 GW、その翌年には 10 GW 以上へと拡大しています。▶ 視聴 · 00:16:40
  • Sassine Ghazi(Synopsys CEO) 氏は、AI チップ設計を現在 L4 と評価し、フロントエンドはすでに 6 ~ 8 つのエージェントで動作していると述べています。2 年前までは「あと 5 ~ 6 年」と言っていたのが間違いだったと認めています。▶ 視聴 · 00:12:56
  • Andy Hock(Cerebras 最高戦略責任者) 氏は、OpenAI が Cerebras のコンピュート 750 MW を購入することに合意し、同社のコーディング製品における高速な Codex オプションは Cerebras 上で動作していると述べています。▶ 視聴 · 00:49:58
  • Pat Gelsinger 氏と SK hynix を含む HBM パネル は、メモリがかつて「4 年に 1 度の好況」だったビジネスで約 90% の利益率を記録しているが、それでも悪いメモリと呼んでいることに言及しています。▶ 視聴 · 0:03:11
  • SemiAnalysis チーム は、Anthropic がすでに黒字化しており、ARR の 80% 以上を高マージンの API 側が占め、第 3 四半期の営業利益は 10 億ドルを超える可能性があると主張しています。
  • Scott Wu 氏は、Cognition のコードの 90% 以上が現在 Devin によってコミットされており、エージェントはすでにほとんどのセッションを自分で開始していると示しています。▶ 視聴 · 5:31
  • Aria Networks の Mansour Karam 氏は、同じ 100 万トークンが 0.20 ドルにも 20 ドルにもなり得る、100 倍の開きがあり、その決定を下す層はネットワークであると述べています。▶ 視聴 · 0:03:38

Jensen Huang · Axios

Fireside Alpha - inline image

全文記事: Jensen Huang が AI 悲観論者に語る:バブルはいつか来る、次の 5 年以内ではない

Jensen Huang(NVIDIA 共同創業者兼 CEO)が、Axios の「Behind the Curtain」で Mike Allen と、フォートワースの新しいチップ工場から、AI バブルが現実的だが数年先のことである理由と、最初に何を構築する必要があるかについて語っています。

半導体業界は今後 10 年で 5 倍から 10 倍に拡大する必要がある。 Huang 氏の見積もりは、メモリ、ストレージ、光インターコネクト、パッケージング、TSMC のキャパシティが同時に不足していることに基づいています。

「半導体業界は現在の 5 倍から 10 倍の規模になる必要があると思います。」

視聴 · 00:32:01

バブルは「いつか」来るが、次の 5 年以内ではない。 Allen 氏は半導体における最も古い疑問、これほど大きな好況は不況を招く運命にあるのか、と迫りました。

「バブルはいつか来ます。ただ今日ではないだけです。これは構築のごく初期段階です。」

視聴 · 00:36:21

NVIDIA の中国販売は「現在ほぼゼロ」。 Huang 氏は、中国市場が閉ざされている間は売上を期待しないよう投資家に伝えました。

「当社の中国販売は現在ほぼゼロです。そしてすべての投資家に、中国での売上は期待しないように伝えています。」

視聴 · 00:06:07

製造業の雇用はここ数年で約 50% 増加。 Huang 氏はこの増加を、トークンを生成する AI データセンターの物理的な構築に関連付けています。

「製造業の雇用数はここ数年で約 50% 増加しました。なぜなら、これらのコンピューターは、トークン、つまり知能を生成する AI データセンターに設置されなければならないからです。」

視聴 · 00:17:27

あなたの仕事を奪うのは AI ではなく、AI を使う人だ。 Huang 氏の反悲観論は、タスクの自動化と仕事全体の排除を区別しています。

「AI が私たちの仕事をすべて破壊するわけではありません。AI を使う人が私たちの仕事を奪うのです。」

視聴 · 00:23:41

常時稼働する 1000 億から 1 兆のエージェント。 現在、任意の瞬間にコンピューターを使用している約 1 億人と比較して。

「常時稼働する 1000 億、1 兆のエージェントが存在するでしょう。賢いエージェント、あまり賢くないエージェント、特化型エージェント、スーパーエージェント、あらゆる種類のエージェントが常に稼働しています。」

視聴 · 01:04:54

Charlie Kawwas · RAISE Summit

Fireside Alpha - inline image

全文記事: Broadcom(Charlie Kawwas):カスタムシリコンがゼロから 1000 億ドルに成長した方法

Broadcom 半導体ソリューショングループ社長の Charlie Kawwas 氏が、RAISE Summit のステージで、BlackRock の Tony Kim 氏に、カスタムシリコンがゼロから 1000 億ドルに成長した方法と、最大の AI ラボが NVIDIA の汎用ラックを離れつつある理由を説明しています。

NVIDIA の汎用ラックには 2 つの税金、効率税とマージン税がかかる。 Kawwas 氏は、最先端ラボが NVIDIA の構築済みコンピュートプラットフォームを購入する際に負うコスト構造を説明しています。

「この汎用コンピュートには税金がかかります。その税金は、第一にそのコンピュートプラットフォームの効率性です。つまり、万人向けに作られているということです。AI フロンティアモデルに特定のワークロードがある場合、余分な税金を支払っていることになります。そしてもう 1 つの税金は、それに伴う高いマージンです。」

視聴 · 00:01:56

各チップ世代は、メモリが 3 倍、コンピュートが前世代の約 3 倍になる。 Kawwas 氏は、連続する年の実際のチップ(2 つのメモリキューブと 6 つ)をホストに手渡しながら述べました。

「昨年から今年にかけて、メモリが 3 倍になります。こちらには 2 つのメモリキューブがあります。こちらには 6 つのメモリキューブがあります。そして中央のコンピュートは約 3 倍強力です。」

視聴 · 00:04:09

大手 AI ラボ 5 社のうち 4 社が Broadcom とカスタムプラットフォームを構築している。 5 社とは OpenAI、Anthropic、Google、Meta、xAI であり、Kawwas 氏の計算では世界の AI 支出の約 90% を占めます。

「米国のビッグ 5 は、現在世界の支出の約 90% を占めていますが、その内訳は OpenAI、Anthropic、Google(Gemini)、Meta、xAI です...この 5 社で文字通り市場の 80、90% 以上を占めています。そしてこの 5 社のうち 4 社は、NVIDIA のテクノロジーが非常に優れていることを認識していますが、ラックレベルでカスタマイズされたこの汎用コンピュートプラットフォームを購入し続けることはできません。」

視聴 · 00:07:56

共同設計は XPU とラック全体の 2 つのレベルで行われる。 Kawwas 氏は、なぜラボがこのカスタムシリコンを既製品で購入できないのか、そして Broadcom がオープンラックを推進する理由に答えています。

「そのオートクチュールには 2 つの部分があります。1 つは、あなたが説明した XPU のための深い共同設計です。2 つ目はラックレベルです。つまり、彼らの LLM と特定のユースケースのために XPU レベルで行うだけでなく、ラック全体がオープンであることを確実にするためにどのように関与するかについても、深く取り組んでいます。」

視聴 · 00:12:18

1 社の顧客が、今年の 1.5 GW から、来年は契約済みの 6.5 GW、その翌年には 10 GW 以上へと拡大する。 AI インフラの次の展開について尋ねられた Kawwas 氏は、チップ数ではなく、大手顧客 1 社の電力で答えました。

「大手 5 社のうちの 1 社に対して、今年は私がお見せしたチップの 1 つで約 1.5 ギガワットを導入しています。来年はおそらく 5 ギガワット以上を導入するでしょう。すでに 5 ギガワットを契約しています...その翌年には、10 ギガワットを超えることは間違いないと思います。」

視聴 · 00:16:40

Sassine Ghazi · RAISE Summit

Fireside Alpha - inline image

全文記事: Synopsys(Sassine Ghazi):チップ設計は「L4」に到達、ウェハー容量が天井に

Synopsys の CEO、Sassine Ghazi 氏が RAISE Summit のステージで、AI がどの程度の速さでチップ自体を設計するようになったか、そして構築がどこでウェハー不足に直面するかについて語っています。

地球上のすべてのチップは、存在する前に Synopsys を通過する、と CEO は述べている。 Synopsys は、チップエンジニアがシリコンをレイアウトするために使用する電子設計自動化ツールを販売しており、現在は Ansys の買収により物理分野にも拡張しています。

「今日、Synopsys なしで設計されるチップはありません。つまり、シリコンレベルでの当社の使用は不可欠であり、広く普及しています。」

視聴 · 00:01:08

トレーニングから推論への移行により、スタック全体にわたってカスタマイズが強制される。 Ghazi 氏は、1 つの汎用 AI チップが GPU、Broadcom スタイルの ASIC、ハイパースケーラーのカスタマー所有ツールに断片化している理由を説明しています。

「その推論効率を達成するには、スタック全体を見る必要があります...そしてそこで、適切な効率、パフォーマンス、コストを達成するために、シリコンのカスタマイズをスタック全体にわたって検討する必要があります。」

視聴 · 00:03:38

データセンターのマージンはコストであり、ハイパースケーラーはそれを削減するために共同設計している。 来週で 1 周年を迎える Ansys の買収により、Synopsys は電子機器とともに熱、流体、構造の物理現象をモデル化できるようになりました。

「データセンターを設計するとき、通常は多くのマージンを見込んで設計します。そしてマージンはコストに等しいです...多くのハイパースケーラーや先進的な顧客が、複数のエンジニアリング領域にわたる共同設計によってこのマージンを削減しようとしているのを目にしています。」

視聴 · 00:07:40

Ghazi 氏は自律型チップ設計を 5 ~ 6 年先と見ていたが、2 年連続で間違っていた。 Synopsys は、自動運転のように設計自律性を L1 ~ L5 で評価し、現在業界は L4 にあり、フロントエンドはすでに 6 ~ 8 つのエージェントで動作しているとしています。

「もし 2 年前にその質問をされたら、これは約 5、6 年先のことだと言っていたでしょう。そして私は過去 2 年間、間違っていました。なぜなら、それは非常に速いスピードで来ているからです。」

視聴 · 00:12:56

ウェハー容量はロジックとメモリの両方で天井であり、Tesla は 2030 年までにシリコン不足を見込んでいる。 構築の制約要因は需要ではなく、物理的なファブの生産能力であり、Ghazi 氏はそれが引き続き圧力になると予想しています。

「現在の制約はウェハー容量によって制限されており、それはロジックウェハー容量とメモリの両方です...Tesla のような企業が、EV からロボティクスへの野心を考えると、2030 年までには、彼らが構想するシリコン需要を支えるのに十分な容量がなくなるだろうと言っているのを聞くと。」

視聴 · 00:14:45

Andy Hock · Cerebras

Fireside Alpha - inline image

全文記事: Cerebras が NVIDIA を倒す計画(Andy Hock、最高戦略責任者)

Cerebras の最高戦略責任者 Andy Hock 氏が、なぜ業界がグラフィックス用に作られたチップを買い続けるのか、そして 1 枚のウェハーサイズのプロセッサをそのまま残したことが、どのようにして OpenAI の 750 メガワットのコンピュート契約を動かすことになったのかについて語っています。

Cerebras は 1 つのチップを構築し、ウェハーを数百個に切断する代わりに、そのまま残す。 業界はウェハーを印刷し、小さなチップに切断し、ボードやデータセンター間で配線し直します。

「1 つのチップ上に、できるだけ多くのコンピュートをまとめて配置し、コンピュート要素がシリコン上で互いに通信できるようにして、多数の小さなチップを配線する必要をなくしたらどうでしょうか? [...] その最後の部分を省略したらどうでしょうか? 1 つの大きなチップを構築して、そのまま残したらどうでしょうか?」

視聴 · 00:15:13

ウェハースケールエンジンは、ほぼ 100 万個のコアを搭載し、製造機では 90 万個。 各コアは独自の高速オンチップメモリバンクを持ち、すべて銅やファイバーではなくシリコン上で接続されています。

「これがウェハースケールエンジンです。 [...] 1 つのデバイスにほぼ 100 万個のコアがあり、製造機では 90 万個です。それらはウェハーの表面全体に 2 次元グリッド状に配置され、すべてのコアが互いに直接接続されています。 [...] この設計により、1 つのデバイス上に AI コンピュートのクラスター相当のものが得られ、従来のチップ設計では不可能な、文字通り 3 桁大きい通信帯域幅とメモリ帯域幅を実現します。」

視聴 · 00:15:45

トレーニングはコストセンターであり、推論はレジを鳴らす場所である。 Hock 氏は AI 経済を、モデルの構築とエンドユーザー向けの実行に分けています。

「トレーニングはコストセンターです。そこではモデルを構築し、望むことを行う方法を教えます。推論はバリューセンターです。モデルが必要なこと、またはあなたやエンドユーザーにとって価値のあることを実行するようになると、推論はレジを鳴らす場所です。」

視聴 · 00:21:45

Cerebras は Gemma 4 を毎秒 1,500 トークンで提供、GPU 実装の 10 倍。 同社はインタビュー当日に Google モデルをプレビューに投入し、その速度を競合他社と比較して引用しました。

「Cerebras は Gemma 4 を毎秒 1,500 トークンで提供しています。これは GPU 実装よりも 10 倍速く、Claude の Haiku モデルなどよりも 15 倍速いです。 [...] 高速なコーディングエージェント。速度はソフトウェアエンジニアの生産性に直結します。」

視聴 · 00:23:16

OpenAI は Cerebras のコンピュート 750 MW を購入することに合意し、Codex Spark はそれ上で動作する。 OpenAI の製品における高速で高価格のコーディングオプションは、内部で Cerebras を利用しています。

「この契約の公開条件は、OpenAI が Cerebras のコンピュート 750 メガワットを購入してそのアプリケーションを動かすというものです。現在 Cerebras を使用しているコーディングモデルは Codex Spark であり、OpenAI チームと協力して、GPT フロンティアモデルから次世代コーディングモデルに至るまで、将来さらに多くのモデルを立ち上げる予定です。」

視聴 · 00:49:58

Cerebras はすべてのメモリをチップ上に保持するため、HBM 不足の影響を受けない。 GPU が重みを引き出す高帯域幅メモリはファブの制約を受けており、命令に応じて拡張できません。

「そのメモリは、ファブリケーションの制限、製造上の制限の影響を受けます。 [...] つまみを回すだけで 10 倍の生産量を生み出すことはできません。そのため、現在そのメモリはそれらのタイプのチップにとってボトルネックとなっています。当社にとってはそうではありません。すべてのメモリをチップ上に持っています。ここにあります。それはそのサプライチェーンの一部ではありません。」

視聴 · 00:30:41

HBM パネル · RAISE Summit

Fireside Alpha - inline image

全文記事: HBM が 90% の利益率を記録、ステージ上の全員が依然として悪いメモリと呼ぶ:AI メモリボトルネックの内部

パリの RAISE Summit で、Pat Gelsinger 氏、SK hynix フェロー Hoshik Kim 氏、投資家 Andrew Homan 氏と Vijay Shilpiekandula 氏が、HBM が約 90% の利益率を記録しているにもかかわらず、ステージ上の全員が依然として悪いメモリと呼ぶ理由について議論しました。

HBM は、かつて 4 年に 1 度しか好況がなかったビジネスで、約 90% の利益率を稼いでいる。 Gelsinger 氏は Intel を複数のメモリサイクルを通じて導き、現在は Playground Global でこの分野に投資しています。

「メモリがこれほど好調だったことはありません。半導体業界では、メモリ企業は 4 年に 1 度しか好況がなく、残りの 3 年は最悪だと冗談を言っていました。」Pat Gelsinger、Playground Global

視聴 · 0:03:11

元 Intel CEO は、SK hynix フェローがすぐ隣にいる中で、HBM を「粗悪なメモリ」と呼ぶ。 Gelsinger 氏の異議は商業的なものではなく物理的なものです。DRAM を積み重ねるとサーマルサンドイッチができ、帯域幅はメモリが GPU と出会う海岸線に固定されます。

「HBM は粗悪なメモリです。メモリ関係者の友人たちがもうすぐステージに上がろうとしているのを知っています。彼らの赤ちゃんを醜いと言うのは、友人を作り影響力を与える最善の方法ではないかもしれません。」Pat Gelsinger、Playground Global

視聴 · 0:04:35

SK hynix 自身のフェローは、HBM はメモリウォールを解決しないと述べている。 Kim 氏は HBM 市場のリーダーである SK hynix でシステムアーキテクチャ研究を率いています。

「良いメモリですが、最終的な答えではありません。HBM はメモリウォール問題を解決しません。メモリウォール問題は本質的な AI の問題であり、避けることはできません。」Hoshik Kim、SK hynix

視聴 · 0:12:49

HBM はファブのスループットを 1 時間あたり 12 枚のウェハーから 4 枚に低下させる。 Homan 氏はキッチンに例えて、製造スループットがなぜ不足の早期解消を妨げるのかを説明しました。

「SK hynix はワッフルメーカーです。通常、ワッフルマシンは 5 分でワッフルを焼くことができます。そのシナリオでは、1 時間に 12 枚のワッフルを作ることができます。HBM では、そのワッフルを作るのに 15 分かかります。そのため、1 時間に 4 枚のワッフルしか作れません。」Andrew Homan、Maverick Silicon

視聴 · 0:19:41

Apple は全製品ラインの価格を引き上げたが、同社は地球上で最も洗練されたメモリ購入者である。 HBM は 2026 年に約 7% の供給不足に直面しており、Homan 氏はこのひっ迫がいつまで続くかを最も明確に示すものとして Cupertino を指摘しました。

「Apple は全製品ラインの価格を引き上げました。彼らは地球上で最も洗練されたメモリ調達マシンであり、明らかにこれがしばらく続くと予想しているため、そうしなければならなかったのです。」Andrew Homan、Maverick Silicon

視聴 · 0:27:50

元 Intel CEO の見解では、メモリ不足はさらに数年続く。 Gelsinger 氏は、3 年前の資本決定によってすでに固定された能力に対して、自身のタイムラインを設定しました。

「豊作の年は何年も先のことです。メモリ不足の年は、まだあと数年は続くでしょう。」Pat Gelsinger、Playground Global

視聴 · 0:29:26

SemiAnalysis Tokenomics · Ep020

Fireside Alpha - inline image

全文記事: SemiAnalysis Tokenomics:Anthropic はすでに黒字化(第 3 四半期に 10 億ドル超)、OpenAI はようやく損益分岐点に戻る

SemiAnalysis Tokenomics チーム(Crystal Huang、Max Kan、Joey Brookhart、ホスト Jordan Nanos)は、モデルラボのマージンについて 1 時間を費やします。Anthropic がすでに黒字化している理由、サブスクリプションが API を補助している方法、メガワットあたりの収益が 3 四半期ごとに 2 倍になっていることなど。

Anthropic の API は ARR の 80% 以上を占め、第 3 四半期の営業利益は 10 億ドルを超える可能性がある。 Joey Brookhart 氏は、非 GAAP、株式報酬を除いたベースで損益計算書に利益を計上しています。

「営業利益は第 2 四半期に黒字化し、第 3 四半期には 10 億ドル以上の黒字になる可能性があります。」Joey Brookhart

Anthropic の API 粗利益率は 85% 以上、20 倍のサブスクリプションプランはマイナスになる可能性もある。 Max Kan 氏が、サブスクリプションと API のマージンが実際にどのようになっているかを説明しています。

「API よりもマージンが悪いという話は忘れてください。少なくとも Anthropic では 85% 以上だと考えています。これらの 20 倍プランでは、全体的にマイナスのマージンになる可能性さえあります。そしてもちろん、これらの企業は可能な限り多くのボリュームを API に移行したいと考えています。」Max Kan

パーセンタイル 99 の企業は、従業員 1 人あたり年間 10 万ドルを AI に費やしている。 Joey Brookhart 氏は、Ramp のカードデータを、多額のコーディング支出に対する ROI のチェックとして読み解いています。

「Ramp のデータによると、パーセンタイル 99 の企業は、従業員 1 人あたり年間 10 万ドルを AI に費やしています。そして、そこまで支出するレベルに達しているなら、明らかにかなり良い ROI を得ていることになります。」Joey Brookhart

エンタープライズプランはサブスクリプションをブロックし、トークンごとの請求を強制する。そこにマージンがある。 Max Kan 氏が、なぜラボが最もヘビーなユーザーを API に誘導するのかを説明しています。

「サブスクリプションを利用できる人は、補助金が非常に手厚いので、間違いなくサブスクリプションを利用すべきです。OpenAI と Anthropic はこれをよく理解しています。エンタープライズプランでは、サブスクリプションを利用させません。トークンごとの支払いを強制します。そこにマージンがあることを知っているからです。」Max Kan

チームの見解:Elon は Colossus の大部分を市場価格の 3 ~ 4 倍で Anthropic にレンタルし、90 日間の收回条項付き。 Max Kan 氏が、コンピュート所有者の立場からフロンティアをレンタルする論理を説明しています。

「フロンティアに到達できることを証明するのに十分なコンピュートをあなたに残します。その間、追加のコンピュートをすべて、これらの非常に高いマージン(市場価格の 3 倍、場合によっては 4 倍)のレンタル契約で収益化します。そして、これらの契約すべてに 90 日間の收回条項が含まれていることを確認します。」Max Kan

フロンティアラボのデータ予算は今年 100 億ドルを超え、昨年の約 10 倍。 Max Kan 氏が、実際にモデル能力を制限するもの、つまりボトルネックは生のコンピュートではなく RL 環境であることについて説明しています。

「強化学習は、今日のモデル能力を向上させるための最も重要なスケーリング則である可能性があります。人間がコンピューターでできることを文字通り何でもモデルに実行させることを妨げている唯一のものは、十分な RL 環境であると信じている人はたくさんいます。」Max Kan

Scott Wu · RAISE Summit

Fireside Alpha - inline image

全文記事(以下のリンク): Cognition(Scott Wu):ソフトウェアエンジニアリングの黄金時代g

Scott Wu(Cognition の CEO、Devin AI ソフトウェアエンジニアの開発者)が RAISE Summit のステージで、自社内の生産性向上はエンジニアチームを縮小するのではなく拡大する理由であると主張しています。

Cognition のコードの 90% 以上が現在 Devin によってコミットされています。 Wu は社内のチャートを提示し、エージェントがパフォーマンスの劣化や DataDog のエラーを検知して、人間の介入なしに自らセッションを開始し始めたことを指摘しました。

「Devin によってコミットされたコードの割合が 90% 以上まで上昇しているのがわかります。私たちは現在、基本的にあらゆることに Devin を使用しています。さらに驚くべきことは、Devin が実際に Devin を起動する作業の大部分も行っていることです。」

視聴 · 5:31

Cognition は、約 40% のエンジニア増員で、6 ヶ月間に 10 倍のソフトウェアをリリースしました。 Wu は 11 月から 4 月末までを自社での実験期間とし、チームを約 45 名から 60 名に拡大。その成長を人員増ではなく、モデルとエージェントによるものと評価しています。

「この 6 ヶ月間で、何が変わったから 10 倍のリリースが可能になり、10 倍の仕事ができるようになったのでしょうか?」

視聴 · 2:36

GPT-3.5 は 30 秒間の自律作業が可能でしたが、最新モデルは 16 時間のジョブを実行できます。 Wu は METR の研究を引用しました。これは、AI が人間に戻ってくるまでにどれだけの長さのタスクを完了できるかを測定するものです。

「GPT-3.5 を見てみましょう。チャートのちょうど真ん中あたりで、30 秒分の作業です。ちなみに、これは悪くない数字です。そして、それが ChatGPT の瞬間でした。」

視聴 · 3:09

2025 年 12 月当時、Devin は 1,000 人あたり 130 人分のエンジニアの追加帯域幅に相当していました。 Wu は、エージェントによる追加のキャパシティを、既存のチームに割り当てられる人員として捉え、その後、その比率が作業の 89~90% にまで上昇したと述べています。

「1,000 人のソフトウェアエンジニアからなるチームを想像してください。彼らに『あなたたちは、さらに 130 人分のソフトウェアエンジニアに相当する帯域幅を得て、ものづくりに取り組める』と伝えられるとしたらどうでしょう。それだけで、多くのことが実現できます。」

視聴 · 8:55

すべてのエンジニアの生産性が 10 倍になり、構築すべきものも 10 倍あります。 Wu は、解雇への懸念に対する回答として、動作する DMV(車両管理局)システムや取得可能な医療記録といった、意図的に地味な、未構築のソフトウェアの例を挙げました。

「すべての人間のソフトウェアエンジニアの生産性は 10 倍になります。しかし、想像してみてください。私たちには、構築すべきものが 10 倍もあるのです。」

視聴 · 10:57

Wu は講演を一つの質問で締めくくりました。それは、無限のソフトウェアエンジニアの軍隊があったら何をするか、というものです。 彼の顧客には Goldman Sachs、Mercedes-Benz、Lowe's が含まれており、各社は数万人のエンジニアを抱えながらも、決して解消されることのないバックログに取り組んでいます。

「無限のソフトウェアエンジニアの軍隊があったら、あなたは何をしますか? 皆さんには、少しだけ時間を取って、そのことについて考えていただきたいと思います。」

視聴 · 1:26

Mansour Karam · RAISE Summit

Fireside Alpha - inline image

Aria Networks の創業者兼 CEO である Mansour Karam が RAISE Summit のステージで、SemiAnalysis の Dylan Patel と共に、「あらゆるものに対応する汎用クラスター」の時代が終わりつつある理由と、ネットワークが推論の経済性を左右する理由について語っています。

トレーニングはコストセンターであり、サービス提供はアパートを賃貸するようなものです。 Karam は AI クラスターを、ハードウェアは共有するものの、経済性はほとんど共有しない 2 つのビジネスに分割しています。

「トレーニングは基本的にモデルを構築することです。それは製品を作るようなものです。しかし、モデルを提供する場合の経済性は、アパートの一室を賃貸するときの資金計画に非常に似ています。」

視聴 · 0:01:34

クラスターを単一のワークロードに特化させることで、10 倍から 100 倍の効果が得られます。 Karam は、単一のユースケースに最適化され、それぞれが一つの指標にチューニングされた新しい企業が形成される余地があると見ています。

「特定のユースケースに最適化するために新たに設立される企業には、多くの機会があると私は見ています。そして、その差は、どの指標を最適化しようとしているかによって、10 倍にも 100 倍にもなり得ます。」

視聴 · 0:02:17

100 万トークンのコストは 0.20 ドルにも 20 ドルにもなり、その 100 倍の差は構築方法によって決まります。 Karam はこの変動を、インフラストラクチャが安価な高スループット推論のために構築されたか、あるいは別の目的のために構築されたかに結び付けています。

「100 万トークンあたり、20 セントから 20 ドルくらいまで、幅があります。つまり、これは 100 倍の差です。本当に高スループットでシンプルな推論に最適化したいのであれば、非常に安価に提供できます。ただし、そのためには、そのことを念頭に置いてインフラストラクチャを構築する必要があります。」

視聴 · 0:03:38

Dylan Patel の言葉:「スピードが堀(競争優位)である」。 Patel は、なぜ高速な領域に突然資金が集中するのか、その需要側の理由を説明します。エージェントは逐次的な試行検証ループで動作するからです。

「エージェントは非常に逐次的で、タスク指向です。何かを試し、検証し、正しいかどうかを確認し、それをループで繰り返します。結果として、非常に遅くなります。そして、スピードこそが堀(競争優位)です。速ければ速いほど、スピードが堀になります。」Dylan Patel、SemiAnalysis

視聴 · 0:07:44

ほこり一粒が混入した一台のトランシーバーが、クラスター上のすべてのユーザーを停滞させます。 単一の推論クエリは、複数のネットワークを順番に通過し、最も遅いリンクが全員のペースを決定します。

「パケットロスが発生したり、ほこりが一粒入ったトランシーバーが一台あると…他の全員が待たなければならなくなり、すべてが逐次的になってしまいます。」

視聴 · 0:11:00

推論クラスター内の 1 秒は「人間のスケールでは 1 世紀のようなもの」です。 Karam は、Aria の提案として、標準的な 1 秒単位の監視では見逃してしまう停滞を捉えるための、マイクロ秒単位のテレメトリを挙げています。

「推論を実行している AI クラスターの文脈における 1 秒は、人間のスケールでは 1 世紀のようなものです。1 秒の間に多くのことが起こります。そのため、本当に必要なのは、このテレメトリをマイクロ秒単位で収集し、停滞を引き起こす可能性のあるイベントを捉えることです。」

視聴 · 0:14:52

ワンクリック保存

YouMindでバイラル記事をAI深読み

ソースを保存し、的を絞った質問をし、主張を要約して、バイラル記事を再利用できるノートに変えます。すべてを1つのAIワークスペースで行えます。

YouMindを探索
クリエイターのために

あなたの Markdown をきれいな 𝕏 記事に

自分の長文を投稿するとき、画像・表・コードブロックを 𝕏 向けに整形するのは手間がかかります。YouMind は Markdown 全体を、そのまま投稿できるきれいな 𝕏 記事に変換します。

Markdown → 𝕏 を試す

解読すべきパターンをもっと

最近のバイラル記事

バイラル記事をもっと見る