DFlash团队进军Mac,27B模型跑到144Token/s
2026-09-19
1 次阅读
RSS订阅
- Inco的Splash本地推理引擎在M5 Max MacBook Pro上运行Qwen3.8-27B模型,最高速度可达144 Token/s。
- 该性能得益于特定模型的GPU内核、内存方案以及DFlash 2小模型并行验证技术。
- LM Studio 0.4.25版本已支持此功能,但运行Splash需要M3+芯片及至少36GB统一内存。
- 目前Splash引擎主要支持Qwen3.8-27B和Qwen3.6-35B-A3B两款模型。
Inco 的 Splash 本地推理引擎在 M5 Max MacBook Pro 上以最高 144 Token/s 运行 Qwen3.8-27B,使用特定于模型的 GPU 内核、内存方案和 DFlash 2 小模型并行验证。LM Studio 0.4.25 支持它;Splash 需要 M3+/macOS 26.4+/≥36GB 统一内存,目前支持 Qwen3.8-27B 和 Qwen3.6-35B-A3B。
📰 来源:https://www.okx.com/zh-hans/feed/post/87796845936832
常见问题
DFlash 团队在 Mac 上实现的 Qwen3.8-27B 模型推理速度是多少?▼
在 M5 Max MacBook Pro 上,通过 Inco 的 Splash 本地推理引擎,Qwen3.8-27B 模型最高可达 144 Token/s 的推理速度。
运行 Splash 本地推理引擎需要哪些硬件和软件配置?▼
Splash 需要配备 M3+ 芯片的设备,运行 macOS 26.4 或更高版本,并且至少需要 36GB 的统一内存。
哪些模型目前得到了 Splash 的支持?▼
目前 Splash 支持 Qwen3.8-27B 和 Qwen3.6-35B-A3B 这两个模型。
用户可以通过哪些工具使用 Splash 进行本地推理?▼
LM Studio 0.4.25 版本支持 Splash 引擎,用户可通过该工具在符合配置的 Mac 设备上运行大模型。
DFlash 团队是如何实现 Mac 上如此高的模型推理性能的?▼
他们使用了 Inco 的 Splash 本地推理引擎,结合特定于模型的 GPU 内核、优化的内存方案以及 DFlash 2 小模型并行验证技术来提升性能。
💬 评论 (0)
发表评论