详情

首页手游攻略 谷歌密谋焊死Gemini:神秘芯片曝光:能效碾压TPU十倍

谷歌密谋焊死Gemini:神秘芯片曝光:能效碾压TPU十倍

佚名 2026-07-21 17:34:15

一觉醒来,谷歌突然就掏出了一张王炸!

据The Information独家爆料,谷歌正在研发一款代号「Frozen v2」的神秘服务器芯片——把Gemini模型的部分底层架构,永久蚀刻进硅片。

不是跑在芯片上,是长在芯片里。

参与项目的谷歌员工预计,按每瓦特能处理的Token数量算,这款芯片将比谷歌最新一代TPU高效6到10倍。部署时间,最快2028年。

消息一出,Alphabet股价周一应声上涨3.7%,一扫前几周的阴霾。

「冻结」一个模型

Frozen这个名字,就是字面意思:把模型「冻」进硅片。

这事有多激进?不管是英伟达GPU还是谷歌TPU,本质上都是通用芯片——什么模型都能跑。

这听起来很灵活,但代价也很大:芯片在运行时必须做海量的实时决策,不停地搬运数据,反复查询该往哪走、该怎么算。

就像一个什么菜都能做的后厨,每做一道菜都得现翻菜谱、现找工具、现调火候。效率可想而知。

Frozen v2则只为Gemini一个模型而生。

它把针对Gemini的关键决策路径直接内建进电路——芯片不用再「想」该怎么走,因为路已经浇铸在硅片里了。

要走的步骤更少,要搬的数据更少,要做的决策更少。相当于给一道菜专门砌了一个灶台,灶眼大小、锅具位置、火候档位,全部量身定制。

省下来的每一步冗余,都变成实打实的能效。

其实,这个想法早有前身。最初的Frozen芯片由Google DeepMind首席科学家Jeff Dean主导,思路更离谱:直接把模型权重烧进芯片。

权重是什么?就是决定模型怎么回答问题的那套核心参数。

但那个方案被搁置了——一旦权重烧死,芯片就只能服务某个特定版本的Gemini,模型一更新,芯片就报废,生命周期短得离谱。

Frozen v2是折中版:不烧权重,只固化架构。底层的计算蓝图刻死,但权重还能更新。

这意味着只要Gemini的架构不大改,芯片就能一直用,新版本的参数照样灌得进去。

不过,谷歌仍在内部权衡,到底把多少东西锁进硅片——锁得越多,效率越高,但灵活性也越差。这个分寸,就是整个项目最关键的工程判断。

算力荒,逼出来的

谷歌为什么要下这步险棋?

答案很简单,也很残酷:算力真的不够用了。

不是「有点紧张」那种不够用,是「送上门的钱都不赚了」那种不够用。

算力短缺已经在谷歌内部引发激烈矛盾,Google Cloud被迫开始拒绝外部客户的订单——在商业公司里,这几乎是最极端的信号。

6月,谷歌签下了一纸合同:每月向SpaceX支付9.2亿美元,租用11万张英伟达GPU的算力,合同一直签到2029年。

一家全球最大的云计算公司,居然要向一家火箭公司租算力——光是这个画面,就足以说明AI军备竞赛已经疯狂到什么地步。

谷歌并不孤独。

全行业都在往推理芯片上疯狂押注:SambaNova、d-Matrix这样的初创公司在做,OpenAI、微软也在做,亚马逊有Trainium和Inferentia,微软有Maia。

英伟达自己都坐不住了——去年12月豪掷200亿美元,拿下推理芯片公司Groq的技术授权。

所有人的目标只有一个:把每一瓦电,榨出更多Token。

而「把模型硬连线进芯片」这条路,此前只有加拿大初创公司Taalas在走——它已从Quiet Capital、富达等投资方融资超2亿美元。

现在,谷歌亲自下场了。

一场豪赌

但十倍能效,不是白拿的。代价是两个字:僵化

只有后续世代的Gemini仍沿用芯片设计时的同一底层架构,Frozen v2才能继续工作。

换句话说,谷歌是在赌——赌自己未来几年不需要大改Gemini的造法。

从纯Transformer到MoE混合专家,从纯文本到多模态原生,从密集推理到稀疏激活——模型架构的迭代速度,堪比手机行业最疯狂的年代。

谷歌自己也清楚这个风险。所以Frozen v2不会做到TPU的产量规模,更像一次有限度的试验:赌对了,就是印钞机,每瓦电多榨几倍Token,数据中心省下来的电费和机柜都是纯利润;赌错了,就当交学费,教工程师学会怎么造更专用的芯片,为下一代积累经验。

值得玩味的是时机。就在上周,彭博爆出Gemini 3.5 Pro因编程能力等多项指标不达标而三度延期。

模型侧腹背受敌的谷歌,突然把更多筹码推向了自己最深的那条护城河——芯片。

从当年自研TPU减少对英伟达的依赖,到今天把模型直接焊死进硅片,谷歌走的是同一条路的更深处:软硬件协同的尽头,是软硬件合体。

AI的竞争开始拼物理

点击查看更多
推荐专题
热门阅读