Perplexity开源Lily推理引擎:Apple Silicon上快过MLX-LM
发布日期:2026-09-03
事件概述
Perplexity开源了Lily,一个面向Apple Silicon混合计算的本地推理引擎。它针对Qwen3.6-35B-A3B做了专门优化,把模型算子直接映射到硬件,用Rust运行时与自研Metal内核减少推理过程中的数据搬运。在M5 Max MacBook Pro上,其预填充吞吐比MLX-LM高1.23倍、解码吞吐高1.35倍。
核心要点
- 定位:Apple Silicon专用本地推理引擎,走混合计算路线
- 优化对象:专门针对Qwen3.6-35B-A3B这一MoE配置调优
- 技术手段:Rust运行时 + 自研Metal内核,目标是压缩数据搬运开销
- 实测:M5 Max MacBook Pro上预填充1.23倍、解码1.35倍于MLX-LM
- 意义:开源,可直接对标社区默认方案
行业意义
端侧推理的工程优化正在从"能跑"转向"跑得快"。当同一个模型在不同引擎上能有20%-35%的吞吐差距时,选择什么运行时就和选择什么硬件一样重要了。