M5 Ultra一来,专业显卡真的要被打回原形了吗?苹果发布了M5 Ultra Mac Studio,36核CPU、80核GPU,最高512GB统一内存,带宽1.2TB/s。AI峰值性能是M3 Ultra的4.3倍,多台Mac Studio可以通过Thunderbolt 5和RDMA集群推理。本地跑大模型的人兴奋,原因很简单,缺的不是算力,是显存。RTX 6000 Ada 48GB显存,NVIDIA官方商城6800美元。RTX PRO 6000 Blackwell 96GB GDDR7,整机成本更高。苹果把统一内存做到512GB,虽然不等于传统显存,速度也不能只看容量,但对个人开发者来说,装下大模型确实多了一种选择。阿里最近发布Qwen3.8-27B,27B参数,Apache 2.0协议。模型越来越大,本地部署的问题也越来越具体。能不能装下,跑起来快不快,比跑分数字更实在。市场端也在变。路透社报道NVIDIA通知大客户AI服务器涨价超15%。Tom's Hardware数据显示RTX 5070涨约36%,RTX 5060涨约27%。显卡和服务器都在变贵,M5 Ultra的整机性价比显得更有吸引力。不过有一点必须说清楚。RTX PRO 6000跑Qwen3.8-27B,公开讨论里FP8大约只有23 token/s,BF16约22到29 token/s。某些宣传数字找不到可靠出处,实际速度差距很大。M5 Ultra这边,M5 Pro大约17到20 token/s,M5 Ultra用Q4量化大约57 token/s,性能不错但没到碾压。所以M5 Ultra会让专业显卡烂在手里吗?还没到这一步。CUDA生态和软件兼容性,短时间内仍是GPU硬优势。苹果真正撬动的是个人开发者和本地模型用户。价格、速度、生态,不可能同时满分。M5未必全面取代专业显卡,但它把本地AI硬件的选择题重新出了一遍。
