3 d9 I: `- L! e' q显卡越来越贵,已经从消费品变成了理财产品。1 K' |9 k( w7 Q# M( @% P2 J2 O
. p4 z: {$ c4 m% `4 h4 y
但这一次,等等党可能真的能赢,只不过赢法跟所有人想的不太一样:并不是等独显降价,是等另外一个品类追上。 $ \1 y) T e9 h( a- ~5 n, z! F& Q& c" W# ~: Q. z
一、不仅内存更大,还更便宜更省电 * g0 f6 k7 B/ v : x" ~" [/ |; e+ r. z- c别急着反驳,从宏观来看,现在是什么时代?$ ]( G$ k" L! x: F6 T$ F
) A$ ^; g, |$ X E大模型时代。 ; E7 \: p0 Q3 i4 N9 i 9 q- s% E7 e' M现在的个人电脑作为大模型载体,就算搭载独显里最强的5090,跑一个70B参数的模型够用,但120B以上或者同时跑多个模型马上降速。, B& C' D1 o8 ]# h+ A. v
& g: @! M" E. K这就是现在独显的短板:算力冗余,却被显存焊死了天花板。 1 E( ]$ i4 g8 n* ]; y r ( a- s# g5 e V$ [# q那么怎么办?这就是开头说的另一个品类:统一内存电脑。 + Q! w6 g( [! T6 K) J* y$ h3 H; d4 ] & I7 i0 |! R8 H有人就会说了,统一内存电脑,这我知道啊,动不动就64G,128G内存,现在的内存又堪比黄金,不得贵死? 7 C& w6 E% S) v: ?1 t/ T 6 [8 @* M+ }2 L" l* t恰恰相反,它比独显便宜得多。 2 q+ X. s+ x* A% T) X* _1 P $ y' a% ?( e% A; {算一笔账:传统PC的独立显存是GDDR6或GDDR7做的,GDDR7目前每GB大约8到10美元,一块16GB显存光颗粒成本就接近150美元。 : K0 R# @4 d' U$ q9 Z6 f 4 E9 t. N) c; T$ Z1 S而LPDDR5X每GB只有2到2.5美元,128GB统一内存的颗粒成本大约250到320美元。 6 \$ w9 {! s0 T% A" ?8 c3 h# x% s3 t3 M8 ]
这么一比较,每GB有效成本直接差出一个数量级,更重要的是,这128GB还能当成显存,它反而是市面上最便宜的显存方案。 : |0 h8 F# ]) N, M( s, d6 p, _& }, l/ X! z
尽管整机溢价目前还在(现在买大内存的统一内存整机确实不便宜),但颗粒成本低是上游趋势,下半年联想惠普宏碁进来卷之后,价格将会逐渐下降,当年SSD刚出也贵,现在呢?; R3 t: a. F! e# i/ i. Y
+ Y# w- a0 o% X k$ f3 d* g如果你去AI开源社区看一眼,会发现拿Mac跑大模型的人早就不是少数了,就是因为苹果那套统一内存方案,是目前唯一能在个人设备上把120B模型装进去还不用掏4万块的选择(如果你就是追求极致速度,统一内存目前不适合你)。 ' D$ i. t0 o1 T v4 z/ m3 w4 z7 n, |6 r' W
其次,CPU,GPU,集成封装的优势会带来功耗的优势。) p- x- f W: T2 \: I
, Y6 W* l0 l: _" _' }, N统一内存把CPU、GPU、内存控制器全部封装在一颗SoC里,信号路径从几十毫米缩短到封装基板上的几个毫米,不用像传统PC那样到处走线。+ o# M9 r" [7 G
1 J' B' I3 j! A+ I4 F% ^3 P
今年Computex期间,多家海外硬件评测机构的实测显示,苹果M系列芯片以30瓦级别的整机功耗,在大模型推理任务上跑出了传统150瓦独显平台70%到80%的性能,单位功耗产出的token数是传统独显平台的3到5倍。 6 C7 x. W1 o$ u( M8 C9 w# u $ H' i" Z, }' P' Q% M \" m7 c A这就有人会问了,照你这么说,统一内存就完美无瑕了呗,还说啥了,算你赢得了。 9 T3 @$ Z, E: r% p$ E 4 c/ ~" f7 v% V别这么说啊,我也没有吹统一内存电脑,它当然不是万能的。 , z3 F @: u+ R/ O* f( }2 }: F1 M# B+ ` j) k0 s' H
二、游戏性能打不过独显,但从0到1已经完成 % I' ^' C! S/ y8 M( R4 a ( |3 b. r; X& v' P8 k我们以英伟达已经发布的RTX Spark为例,这是一颗把Blackwell RTX GPU和20核Grace CPU焊在一起的消费级超级芯片。 # ~' G, H. G: g [ ?" A; p( V# U2 R9 l& I6 G& p& G8 y) j: {
RTX Spark的GPU部分塞了6144个CUDA核心,跟RTX 5070笔记本版是同款规模,128GB LPDDR5X统一内存,本地能跑120B参数模型加百万token上下文。 : x _2 G/ z1 _2 T9 F# g/ E5 T$ ^ / d; Y4 Z @& D0 A) ], c前文在比较内存颗粒价格的时候,相信有不少人疑惑:两种内存颗粒,怎么就放一起比较? 2 b& I9 v0 w1 V, u. x# V / l# N N6 {1 {+ I( _# a这就是我想说的统一内存最大的短板:因为成本限制,只能采用LPDDR(5x),而LPDDR5X的系统内存带宽只有大约273GB每秒,桌面版5070配的是GDDR7显存,带宽672GB每秒,差了近三倍。 % ^7 R9 x3 O) B; y- w5 ~ & C# b1 W4 n2 E+ \0 E因为游戏场景里纹理、几何、光影数据全从内存带宽过,LPDDR5X这条273GB每秒的窄水管拖了后腿。 8 T- R& H0 i0 O; S v {3 S8 y* R/ n3 B
Computex期间,多家硬件评测机构的实测也显示,在未经UMA专门优化的传统3A游戏场景下,同算力的统一内存平台比传统独显方案帧率低15%到25%。 [# F) }5 z- X+ G8 H1 A; O+ r% }" r8 x
至于英伟达在发布会上说玩3A能1440p跑100帧以上,肯定是靠DLSS的帧生成硬堆上去的,关掉插帧后原生帧率能到40就算它厉害了。 - S! v2 [/ D% a% O; s2 h% H- d$ T ( F4 l5 F) a/ i当显存的优势被夷平后,带宽就成了独显最后的护城河,也成了统一内存下一个要啃的骨头。 4 q% M+ E& B6 ?* A7 V1 S ' [* ?: y( Y& Y( M但对于科技产品来说,这并不是什么问题,因为基本都是先拿半成品上市,完成从零到一的跨越,剩下的就是堆参数做优化的事情,1 \, }: Y) A( a
9 _! T& p* A$ n* A/ s# ~+ [" j% ]
所以说这个短板恰恰是迭代的起跑线,而不是终点。 9 Z6 f9 R7 s7 J9 K* L- s! ]# x: ]# |( w! i: y
核心数可以继续从6144往上堆,因为Blackwell架构本身就留了扩展空间;带宽方面,三星和SK海力士的LPDDR6今年底量产,可用带宽从约273 GB/s提升到约415 GB/s,提升近50%,并大幅拉近与GDDR7之间的差距。* B. t- C7 L, S- z$ W
8 P3 M: Z: ~4 i/ B虽然帧率不会等比例翻倍,但足以把目前15%-25%的差距大幅缩小。' r- h8 ?! L9 }9 n: w" S; M' C- b
2 E# `4 U+ [ S
包括什么散热抢电还有位宽的问题,厂商不断优化就行了。 ' @: S1 A: f8 b& W; j4 Z1 u 7 A0 R' _* K* n% Z+ ~/ s- o三、统一内存是大势所趋,但独显也不会消失 ! `) I$ M: U& c* V; M) Q. W' w $ b) ] @, |. Y1 t说了这么多,我的意思是,电子产品的小型化,集成化是趋势,统一内存电脑在大模型时代将慢慢成为主流。 : I5 t! U3 H* a6 a8 a9 U : J* K6 l7 c: C7 P; [9 L这和当年电动车追上燃油车的逻辑有相似之处,电动车刚出的时候续航一样拉胯,靠的是能源效率和结构简化慢慢做到今天的地步。, W, a) H, j) y4 y4 z
1 i" x9 j9 A8 ~统一内存也一样,不和独显拼算力更高,而是靠架构红利,先把“能装下”这个事搞定,速度再慢慢迭代。 H( f( I ^( \- c1 c0 w( f9 | N' m
9 i* d) z" g9 q: {" DAMD更是抢在英伟达之前提前占位,锐龙AI MAX PRO 400系列用192GB统一内存锁定了AI工作站这个细分市场。 7 A* z; k1 Z: E) {, T1 D 6 Y+ M( ?4 |+ n( G. c英伟达在GTC台北正式发布RTX Spark之后,宏碁、华硕、联想、戴尔、惠普、微软、微星七大OEM厂全部宣布跟进,首批搭载RTX Spark的笔记本和小型台式机预计今年秋季开始交付。 $ W& q* u) i; j) s5 V 7 T1 B3 x. @+ g! y9 |: G如果统一内存只有苹果和AMD在搞,倒是可以认为统一内存就是个空中楼阁,是个小众概念,但现在全球最大的独显头子英伟达都下场了,一个最希望独显不被替代的公司都开始做统一内存了,那只能说统一内存变成了“整个PC行业在搞的那个东西”。1 d, i( o5 v8 A) A6 C
, B8 J* g; Z: R. R入场的人一多,统一内存电脑的价格自然就会下降。 + S2 P) z+ N4 q. A+ H3 \- E1 g/ t7 U2 q. ?9 [& q$ u$ M) G: a9 h r
这和当年电动车取代燃油车的逻辑如出一辙,电动车不是靠跑得更快赢的,是靠能源效率和机械结构简化赢的。+ M8 Y" D/ P' w5 ~/ C
7 E8 b* V7 W) G7 Z- g7 q" m* i
统一内存不是靠算力更高赢的,是靠架构红利赢的:同样的容量成本更低,可以塞更多更大的模型,虽然速度慢,但同样的功耗产出更多,故障率还低。 7 J R+ D4 U: Q$ M 8 P4 S3 O1 i* L! {; ?当这三个条件同时成立的时候,主流市场的天平就会开始倾斜。6 e5 X; j# ~6 U, N/ V0 r, I
& b. C n) ^& K* x) B, \* K7 J1 _+ p但独显并不会消失,就像燃油车不会灭绝一样,对于有游戏需求和跑打大模型需求的用户来说,统一内存电脑是最佳选择,但如果单纯是希望4k光追画质拉满的游戏发烧玩家或者是专业工作室做8K视频渲染和工业级3D建模,那独显可能还是最好的选择。 $ S% ^" m g7 ]8 I