! b/ L" o/ s2 W2 q: B* ?+ c5 I! ]( y
前一阵子,各品牌显卡工厂全面封仓、暂停出货,等待8月重新定价,与此同时国内RTX 5090的售价已经近4万元,RTX 5070 Ti国内渠道报价也站上了一万元关口。 " R7 y1 n9 O" ^) t& ]+ [5 } / I1 ]! v, b( |8 @, Q显卡越来越贵,已经从消费品变成了理财产品。 $ L% j' ]/ b' [- G6 \* N ( V( J. V ]1 a* ~! j% V但这一次,等等党可能真的能赢,只不过赢法跟所有人想的不太一样:并不是等独显降价,是等另外一个品类追上。 - M- p5 ~6 b6 ~; W* ^# l6 Y. N # i* m1 s9 Y! @5 K一、不仅内存更大,还更便宜更省电# Y% `$ d* M0 Y' J7 i
- \/ n& h# _! ]# O: W. I7 ?别急着反驳,从宏观来看,现在是什么时代? / g7 B& Z) r' m6 r: R5 C ?3 l9 M! D$ Y2 K7 C) i大模型时代。! G* ?$ ~6 h1 q8 B" p" j- z
/ o+ l7 l" J! y现在的个人电脑作为大模型载体,就算搭载独显里最强的5090,跑一个70B参数的模型够用,但120B以上或者同时跑多个模型马上降速。* [9 a; [% V G8 g* _) U& l
2 n3 m% J( ?3 e6 K( X' |7 h0 M这就是现在独显的短板:算力冗余,却被显存焊死了天花板。" x" c4 q _7 v s o$ G
6 l" w3 O( g$ \# L那么怎么办?这就是开头说的另一个品类:统一内存电脑。$ B ~. W# K/ C$ T! |
! U6 o* n+ \2 [. f$ a" M
有人就会说了,统一内存电脑,这我知道啊,动不动就64G,128G内存,现在的内存又堪比黄金,不得贵死?' ^ [" ]) U& a7 k \% H- F. I! v
9 {6 l9 E. L6 n, E4 \0 e
恰恰相反,它比独显便宜得多。 9 Q" C; B8 h0 w, w, L0 i/ m) o. w$ V: [# |3 l
算一笔账:传统PC的独立显存是GDDR6或GDDR7做的,GDDR7目前每GB大约8到10美元,一块16GB显存光颗粒成本就接近150美元。 8 I6 O i2 Y" W: [7 v . p- q) D; u7 }5 k& ^- ~而LPDDR5X每GB只有2到2.5美元,128GB统一内存的颗粒成本大约250到320美元。& A/ r: X2 P* E6 Y/ x" X
! V$ j1 x: W2 B" E% a这么一比较,每GB有效成本直接差出一个数量级,更重要的是,这128GB还能当成显存,它反而是市面上最便宜的显存方案。 M) V0 I8 K5 v ]! @* j- `" d6 p" Z( C) Q: _" D
尽管整机溢价目前还在(现在买大内存的统一内存整机确实不便宜),但颗粒成本低是上游趋势,下半年联想惠普宏碁进来卷之后,价格将会逐渐下降,当年SSD刚出也贵,现在呢? ; Q$ B7 _/ z; }" ^# H . n* j! O$ `6 t1 i" u1 X" t如果你去AI开源社区看一眼,会发现拿Mac跑大模型的人早就不是少数了,就是因为苹果那套统一内存方案,是目前唯一能在个人设备上把120B模型装进去还不用掏4万块的选择(如果你就是追求极致速度,统一内存目前不适合你)。 % [; h/ A+ r w8 {* ^! V0 O- \6 b# r+ T$ A2 M% {, @' a0 n- i3 U2 I
其次,CPU,GPU,集成封装的优势会带来功耗的优势。 ' z, c+ p8 C r5 n1 i2 C9 N; b; f2 x) j( P. K2 C/ Y
统一内存把CPU、GPU、内存控制器全部封装在一颗SoC里,信号路径从几十毫米缩短到封装基板上的几个毫米,不用像传统PC那样到处走线。 ) j H0 y7 B* A/ d3 S9 W, p" C/ C 1 `' [2 d6 {$ p5 @& ~今年Computex期间,多家海外硬件评测机构的实测显示,苹果M系列芯片以30瓦级别的整机功耗,在大模型推理任务上跑出了传统150瓦独显平台70%到80%的性能,单位功耗产出的token数是传统独显平台的3到5倍。# N6 R; w$ A% J
, I; J9 Y8 |- F/ Z
这就有人会问了,照你这么说,统一内存就完美无瑕了呗,还说啥了,算你赢得了。9 j7 v5 ^ i0 S5 {# T
% Q( I& M. l1 y3 h$ A+ |
别这么说啊,我也没有吹统一内存电脑,它当然不是万能的。 6 j, M- ]$ T7 O# ~# B3 A. f: `- {5 \# W
二、游戏性能打不过独显,但从0到1已经完成 ; M) v* v0 x0 j5 o, b+ K 3 r- {' S6 X9 D% g* Z+ C9 p k1 l' }我们以英伟达已经发布的RTX Spark为例,这是一颗把Blackwell RTX GPU和20核Grace CPU焊在一起的消费级超级芯片。% `9 v) \+ _) D8 J, n }: j* [
' y r3 A9 s2 E- H( YRTX Spark的GPU部分塞了6144个CUDA核心,跟RTX 5070笔记本版是同款规模,128GB LPDDR5X统一内存,本地能跑120B参数模型加百万token上下文。- K: Z3 P) M+ M7 w
, [! Z4 ?! i/ }$ w
前文在比较内存颗粒价格的时候,相信有不少人疑惑:两种内存颗粒,怎么就放一起比较?% A, c1 n) f( ?/ a. C
. o% @! M- [% g n这就是我想说的统一内存最大的短板:因为成本限制,只能采用LPDDR(5x),而LPDDR5X的系统内存带宽只有大约273GB每秒,桌面版5070配的是GDDR7显存,带宽672GB每秒,差了近三倍。 ' {) U% `1 m3 V s; a( M/ x4 B ]5 V3 t
因为游戏场景里纹理、几何、光影数据全从内存带宽过,LPDDR5X这条273GB每秒的窄水管拖了后腿。% C/ S( }. @! d& b' N; p, T) t+ F
! [' g) K% x8 m& m6 tComputex期间,多家硬件评测机构的实测也显示,在未经UMA专门优化的传统3A游戏场景下,同算力的统一内存平台比传统独显方案帧率低15%到25%。 4 u9 W- @4 [" E& [4 N- U2 B 9 y" y" \* f u- `. p2 P8 F G: C至于英伟达在发布会上说玩3A能1440p跑100帧以上,肯定是靠DLSS的帧生成硬堆上去的,关掉插帧后原生帧率能到40就算它厉害了。' M8 m! @( _$ I0 S/ `' b6 @
2 p2 E/ d# \; {3 S4 t2 P3 C' M& H
当显存的优势被夷平后,带宽就成了独显最后的护城河,也成了统一内存下一个要啃的骨头。 # o* x. l' z& n8 m1 c0 V6 Q) q% \2 I) y" @* L/ i
但对于科技产品来说,这并不是什么问题,因为基本都是先拿半成品上市,完成从零到一的跨越,剩下的就是堆参数做优化的事情,3 l; [. @& N$ J/ M/ M1 e
) N% N) S& `+ V. B7 F" N所以说这个短板恰恰是迭代的起跑线,而不是终点。 / J: \; I2 e3 b- k/ }8 `/ u2 Z1 {* [' n9 v
核心数可以继续从6144往上堆,因为Blackwell架构本身就留了扩展空间;带宽方面,三星和SK海力士的LPDDR6今年底量产,可用带宽从约273 GB/s提升到约415 GB/s,提升近50%,并大幅拉近与GDDR7之间的差距。 ; P2 D. n1 \8 S! J" t: ^$ @* I6 O3 U, S! U
虽然帧率不会等比例翻倍,但足以把目前15%-25%的差距大幅缩小。 3 b# _6 T, F4 M8 Z! @9 ` 1 q! x6 a9 R% d' B; R1 R! @) c包括什么散热抢电还有位宽的问题,厂商不断优化就行了。, B+ C/ f2 m2 q4 I4 m2 I6 P) E
, ?, e+ L0 u7 C3 I& M6 g* c8 Z三、统一内存是大势所趋,但独显也不会消失! a) ~) \" L$ L+ i
6 W3 V' F7 z8 u
说了这么多,我的意思是,电子产品的小型化,集成化是趋势,统一内存电脑在大模型时代将慢慢成为主流。 . } m. m. O2 F0 |0 h# w- L' E* Z8 {' |+ f
这和当年电动车追上燃油车的逻辑有相似之处,电动车刚出的时候续航一样拉胯,靠的是能源效率和结构简化慢慢做到今天的地步。1 L4 [# F7 g, D f% t. m& f
' u' h) x. L; W ~$ W统一内存也一样,不和独显拼算力更高,而是靠架构红利,先把“能装下”这个事搞定,速度再慢慢迭代。( m% \. R, Y) b9 P% P2 M
& j$ N% ]6 E z- q" n; u9 L目前的统一内存电脑,苹果用了六年时间把这条路从0走到1,从2020年M1到最新的M4,每一步都在证明消费端统一内存不但是可行的,而且正在吃掉传统PC的市场份额。 4 J' z# `9 q; j5 J7 b 9 l% z* C3 T. L9 ]AMD更是抢在英伟达之前提前占位,锐龙AI MAX PRO 400系列用192GB统一内存锁定了AI工作站这个细分市场。, Q8 _% {7 _! `4 S5 E: _$ J" }
3 L% D F: b# ?' G8 R
英伟达在GTC台北正式发布RTX Spark之后,宏碁、华硕、联想、戴尔、惠普、微软、微星七大OEM厂全部宣布跟进,首批搭载RTX Spark的笔记本和小型台式机预计今年秋季开始交付。 7 G" ?4 p, N& d/ o# w! ]. C9 u% S9 E+ H$ s1 V
如果统一内存只有苹果和AMD在搞,倒是可以认为统一内存就是个空中楼阁,是个小众概念,但现在全球最大的独显头子英伟达都下场了,一个最希望独显不被替代的公司都开始做统一内存了,那只能说统一内存变成了“整个PC行业在搞的那个东西”。 & d" ?, N6 h9 C% O5 [8 z0 t' r9 b/ N' a) z" l' K1 `4 H( w) ?
入场的人一多,统一内存电脑的价格自然就会下降。 . {& R5 ?. C U4 M% j. z 3 S. n, ?: `1 f( l这和当年电动车取代燃油车的逻辑如出一辙,电动车不是靠跑得更快赢的,是靠能源效率和机械结构简化赢的。 6 a, c! {! i9 B- U1 @+ v- {; N3 Q; @' H) ?8 b! u
统一内存不是靠算力更高赢的,是靠架构红利赢的:同样的容量成本更低,可以塞更多更大的模型,虽然速度慢,但同样的功耗产出更多,故障率还低。 $ ?8 r+ C+ ], x0 M$ O) R; Y I& h- q; w7 V9 Y) a2 q* V5 x当这三个条件同时成立的时候,主流市场的天平就会开始倾斜。 ! c t9 W# V7 Q/ U3 f5 x7 \0 p5 {! _3 B u; G- S
但独显并不会消失,就像燃油车不会灭绝一样,对于有游戏需求和跑打大模型需求的用户来说,统一内存电脑是最佳选择,但如果单纯是希望4k光追画质拉满的游戏发烧玩家或者是专业工作室做8K视频渲染和工业级3D建模,那独显可能还是最好的选择。0 N! q# t" ]3 H7 Y$ n% {# N$ x$ B