紧那罗 发表于 2026-8-26 09:15

苹果悄悄上架了M5 ultra和M6

16+256只售142999!

utakata 发表于 2026-8-26 09:17

还真是16+256

KevinGraham 发表于 2026-8-26 09:18

后面16+512的皇帝版估计再加70000吧,219999这样
顺便苹果这个首发了消费级(?)pcie6.0固态的样子

沙发沙发 发表于 2026-8-26 09:22

这个16+256能跑ds v4f吗

培根芝士蛋堡XD 发表于 2026-8-26 09:35

本帖最后由 培根芝士蛋堡XD 于 2026-8-26 09:37 编辑

沙发沙发 发表于 2026-8-26 09:22
这个16+256能跑ds v4f吗
512g理论上可以跑满血的1M dpsk v4f,LLM时代内存和显存统一的优势出来了,现在对比N卡服务器价格,看M5 ultra甚至性价比爆表

starash 发表于 2026-8-26 09:56

现在内存已经不是金条,要称之为铑条了。

snarc1 发表于 2026-8-26 10:46

太贵了,m5ultra的带宽很惊人

论坛助手,iPhone

netplaying 发表于 2026-8-26 11:34

本帖最后由 netplaying 于 2026-8-26 11:41 编辑

之前512g的m3 ultra就是性价比最高的本地部署超大模型的选择,671B参数量的DeepSeek V3/R1 Q4精度的MoE模型都能跑。部署成本只有nvidia方案的十分之一不到。当然输出速度也只有nvidia的十分之一,不过个人玩玩也足够了。

natt 发表于 2026-8-26 12:30

mini max h3抽卡能比pro6000快不

雪影 发表于 2026-8-26 14:09

natt 发表于 2026-8-26 12:30
mini max h3抽卡能比pro6000快不

那真不能
Ultra主要还是给DSV4F和3.8 MAX的

雪影 发表于 2026-8-26 14:11

本帖最后由 雪影 于 2026-8-26 14:22 编辑

512比较尴尬,跑DSV4F有点多,跑GLM5.3不够,要是有个768就完美了

256跑DSV4F又不够
128跑27B太多

培根芝士蛋堡XD 发表于 2026-8-26 15:21

雪影 发表于 2026-8-26 14:11
512比较尴尬,跑DSV4F有点多,跑GLM5.3不够,要是有个768就完美了

256跑DSV4F又不够


显存不会嫌多的,拉高并发之类的总是有用

noword 发表于 2026-8-26 17:10

雪影 发表于 2026-8-26 14:11
512比较尴尬,跑DSV4F有点多,跑GLM5.3不够,要是有个768就完美了

256跑DSV4F又不够


256够了吧,v4f是8bit/4bit混合,不到160G

培根芝士蛋堡XD 发表于 2026-8-26 18:18

noword 发表于 2026-8-26 17:10
256够了吧,v4f是8bit/4bit混合,不到160G

现在一般agent会启动多个subagent子代理,加上这个内存你还要和系统本身共用,部署1M dpsk v4f我觉得256g很难顶住

startraveller 发表于 2026-8-26 18:30

培根芝士蛋堡XD 发表于 2026-8-26 18:18
现在一般agent会启动多个subagent子代理,加上这个内存你还要和系统本身共用,部署1M dpsk v4f我觉得256g ...

Deepseek V4是CSA/HCA,1M上下文没量化就不到10G,量化就5G,还是够的

德尔惠净水器 发表于 2026-8-26 18:38

m6换新架构了吗

培根芝士蛋堡XD 发表于 2026-8-26 19:40

startraveller 发表于 2026-8-26 18:30
Deepseek V4是CSA/HCA,1M上下文没量化就不到10G,量化就5G,还是够的

改大项目的时候,dpsk harness一口气开8个subagent都能看见,不量化还是比较难的

startraveller 发表于 2026-8-26 20:16

培根芝士蛋堡XD 发表于 2026-8-26 19:40
改大项目的时候,dpsk harness一口气开8个subagent都能看见,不量化还是比较难的 ...

8个都占满1M上下文的情况的话与其担心内存,更需要担心的是M5的prefill速度……

培根芝士蛋堡XD 发表于 2026-8-26 20:25

startraveller 发表于 2026-8-26 20:16
8个都占满1M上下文的情况的话与其担心内存,更需要担心的是M5的prefill速度…… ...

subagent也不是prefill,这主要是decode的问题,多并发容易打满算力bound导致单agent吞吐下降,这个也正常,但是总比oom要好

水母干 发表于 2026-8-27 00:03

模型3~4个月就会过时,今天发布的Qwen3.8-Flash-Next就超越了DeepSeek V4 Flash 0731而且体积还只有一半,也可以通过扩展开到1M上下文,256G拿来跑这个刚好。至于512G内存版本可以拿来跑今天发布的GLM5.3 Flash。
内存不够用的话,把冷对话的KV Cache驱逐到别的机器上的内存就可以了,vllm/sglang结合LM Cache很简单。

雪影 发表于 2026-8-27 09:46

大模型迭代太快了,昨天又开源了2个
GLM-5.3-Flash 320B激活18B,512G刚好够用
Qwen3.8-Flash-Next 125B激活6B,256G也刚好够用

tylunas 发表于 2026-8-27 10:00

昨天贩子给不知道几手的大船DGX-2 16卡V100的报价是13W,相比之下全新机真的划算了。

owada 发表于 2026-8-27 13:54

一辆海豹06居然在桌上

lain2008 发表于 2026-8-31 22:16

m5 max版本的mbp16,居然充电跟不上耗电,140w充电器在满功耗状态下,每小时电池取电12%

FurryBall 发表于 2026-8-31 23:09

lain2008 发表于 2026-8-31 22:16
m5 max版本的mbp16,居然充电跟不上耗电,140w充电器在满功耗状态下,每小时电池取电12% ...

毕竟模具是2021那一套,充电器是2021那一套,magsafe充电线是2021那一套

c2c充电线很早前就已经很早就已经有满足48v5a的EPR协议,只是magsafe数据线的升级遥遥无期,大概率还是等着MacBook模具一起升,可能是2027年,也可能伴随新芯片会更晚
页: [1]
查看完整版本: 苹果悄悄上架了M5 ultra和M6