今年的 IFA 展会开场有点不一样:AMD 拿下了开幕主题演讲的位置,这也是这个办了 102 年的展会历史上,第一次由芯片公司来做开场。而 AMD 带来的东西,也确实配得上这个「第一次」——一台能在本地跑万亿参数大模型的工作站。
本地跑万亿参数,卡点到底在哪

要理解 AMD 这次为什么值得关注,得先搞懂一个老问题:为什么大模型总得往云端跑。
传统 PC 和工作站把内存分成两块——系统内存归 CPU 用,显存归显卡用。一个模型要想被 GPU 处理,数据得先从系统内存复制到显存里。这带来一个硬性天花板:只要模型体积超过显存容量,这块显卡就根本跑不动它,不管你机器里还插着多少条系统内存。
拿现在最强的消费级显卡来说,RTX 5090 的显存是 32GB。而一个 3000 亿参数的模型,即便用 FP4 这种压缩格式,也要吃掉大约 150GB。这意味着,无论你花多少钱,单块显卡都装不下这种规模的模型——本地跑大模型的愿望,卡在的就是这道「显存墙」上。
AMD 的统一内存,绕开了这道墙

AMD 这次的 Ryzen AI Max Pro 400 平台(代号 Kraken Halo)换了个思路:不设独立显存,而是用 256-bit 的 LPDDR5X 内存接口,把 CPU、GPU、NPU 接到同一个内存池上。也就是说,系统内存就是显存。
这个平台最高 192GB 的总内存里,有 160GB 可以分配给 GPU 任务。这么一算就通了:160GB 大于 300B 模型 FP4 格式需要的 150GB——一个在任何单块显卡上都跑不起来的负载,在这台机器上可以本地运行。
内存带宽方面,理论峰值大约 273GB/s,比上一代提高了 6.6%。对大模型推理来说,内存带宽才是真正的瓶颈(而不是算力),带宽越快,本地生成的 token 速度就越快。对实际用下来的人来说,这直接决定了本地跑模型是「能用」还是「卡得没法用」。
液冷工作站,把门槛拉到了桌面

更重磅的是 AMD 同步发布的 Threadripper Halo Station,一台液冷工作站,官方称它可以在本地运行超过一万亿参数的大模型,全程不依赖云端。
与此同时,联想和惠普也带来了首批商用系统:联想的 ThinkCentre X 是一台紧凑型桌面机,跑的就是 Ryzen AI Halo 平台。旗舰芯片 Ryzen AI Max+ PRO 495 堆了 16 个 Zen 5 核心、40 个 RDNA 3.5 计算单元,以及 55 TOPS 的 NPU。
对普通用户来说,这些产品短期内还不是「买回家插上就玩」的东西,价格和定位都偏专业工作站。但它传递的信号很清晰:本地大模型的门槛正在快速下探,过去只有数据中心能干的事,正在被拉到一张桌子的范围里。
Ryzen AI Max Pro 400 到底堆了什么料

再往细里看这套平台,你会发现它不只是「内存大」这么简单。旗舰型号 Ryzen AI Max+ PRO 495 集成了 16 个 Zen 5 CPU 核心(最高 5.2GHz)、40 个 RDNA 3.5 计算单元,以及 55 TOPS 的 XDNA 2 NPU。
那个 55 TOPS 的 NPU 值得单独说一句——微软给 Copilot+ PC 设的认证门槛是 40 TOPS,AMD 这颗已经稳稳超过,意味着它在端侧 AI 加速上有正经的硬件支撑。整个 Kraken Halo 家族从 8 核到 16 核,覆盖了不同预算和性能档位。
标准版和 PRO 版之间的区别,主要在企业管理和安全特性上,基础规格完全一致。也就是说,普通用户买到的标准版,性能核心是一样的,不会因为少了 PRO 后缀就被阉割。
这件事为什么值得普通人留意

可能有人会觉得,万亿参数的本地 AI 跟自己没关系。但技术的下沉路径通常是这样的:先在最顶端证明可行性,再逐年把价格打下来、把体积缩下去。
再换个角度看,这套统一内存的思路,其实也已经在向更接近普通人的产品渗透。AMD 同期发布的 Ryzen AI Max Pro 400 系列,本身就有面向更广用户的型号,未来这套「内存即显存」的架构如果能进一步下沉到游戏本、一体机甚至桌面主机,那普通人离「本地跑大模型」的距离还会再近一步。
几年前「本地跑大模型」还是笑话,现在 3000 亿参数已经能塞进工作站,千亿、百亿级模型的本地化只会越来越便宜。对企业来说,数据不出本地意味着更可控的隐私和合规;对开发者来说,省下的是云端推理的钱。所以哪怕你现在用不上,也值得知道这件事正在发生——本地 AI 的时代,确实在一点点逼近。
本地 AI 这条路,还会怎么走
把这届 IFA 的信号连起来看,会发现「本地 AI」已经不只是 AMD 一家在喊了。英伟达同期也在推 RTX Spark 架构和本地 AI 部署方案,各家芯片厂商都在往「端侧、本地」这个方向使劲。
背后的逻辑其实很朴素:云端推理有延迟、有隐私顾虑、还有持续的成本,而很多场景——比如企业内部的敏感数据、需要低延迟响应的应用——恰恰更适合在本地跑。谁先解决「显存墙」这道坎,谁就能在下一轮竞争中占得先机。
AMD 这次用统一内存的思路,把门槛从「数据中心」拉到了「桌面工作站」。虽然离普通消费级还有距离,但技术一旦跑通,往下普及的速度往往比想象中快。对关注 AI 的普通用户来说,值得记住这个时间点:本地跑大模型,从今天起不再只是设想。