← 返回实战笔记

本地部署 / 实测长文

单台 DGX Spark 跑 Ling 3.0 Flash MXFP4:一次实测记录

从内存溢出和底层适配排错,到约 40 Token/s 的稳定生成。一次把性能、可比性和安全误报都讲清楚的部署复盘。

2026-08-18 / 实战记录

86,375原帖浏览
90喜欢
65转帖
42书签

2026-09-08 采集的公开页面数据,非实时统计。

01这篇文章解决什么问题

128GB 统一内存的 DGX Spark,能否稳定运行 124B 级 MoE 模型?我从官方路径遇到的内存溢出出发,记录了量化布局、推理后端与真实请求验证的区别。低激活参数量可以减少计算,却不意味着全部权重不需要驻留。

02值得关注的实测结果

我报告:单并发、四类任务、20 次正式请求全部完成,MXFP4 平均持续解码 39.95 Token/s,平均首块响应时间 0.211 秒。首次预热却耗时 47 秒,冷启动与稳定运行必须分开衡量。

03为什么不能直接排模型名次

另外三套部署的解码均值分别为 34.92、14.89 和 9.94 Token/s。但提示词、思考模式、后端与日志完整度没有完全对齐,因此这些是本次部署的观测值,不是模型能力或硬件极限排名。

04最有价值的排错经验

我把下载完成、权重加载、接口就绪、首次计算成功和持续生成分成不同阶段。安全测试还发现了关键词判定的误报:未匹配拒绝短语,不等于输出有害内容;长时间生成完成率,也不等于安全通过率。

继续阅读其他实战笔记 →