DFlash团队进军Mac,27B模型跑到144Token/s

2026-09-19 1 次阅读 RSS订阅
Inco 的 Splash 本地推理引擎在 M5 Max MacBook Pro 上以最高 144 Token/s 运行 Qwen3.8-27B,使用特定于模型的 GPU 内核、内存方案和 DFlash 2 小模型并行验证。LM Studio 0.4.25 支持它;Splash 需要 M3+/macOS 26.4+/≥36GB 统一内存,目前支持 Qwen3.8-27B 和 Qwen3.6-35B-A3B。

📰 来源:https://www.okx.com/zh-hans/feed/post/87796845936832

常见问题

DFlash 团队在 Mac 上实现的 Qwen3.8-27B 模型推理速度是多少?
运行 Splash 本地推理引擎需要哪些硬件和软件配置?
哪些模型目前得到了 Splash 的支持?
用户可以通过哪些工具使用 Splash 进行本地推理?
DFlash 团队是如何实现 Mac 上如此高的模型推理性能的?