Perplexity开源Lily推理引擎,面向苹果芯片优化
发布日期:2026-09-15
事件概述
Perplexity 开源了面向苹果芯片的本地推理引擎 Lily,专门针对 Qwen3.6-35B-A3B 优化,把模型运算直接映射到硬件;在 M5 Max MacBook Pro 上,prefill 吞吐比 MLX-LM 高 1.23 倍、decode 吞吐高 1.35 倍。引擎使用 Rust 运行时与定制 Metal kernel,目标是最大限度减少推理过程中的数据搬运。
核心要点
- 路径:苹果芯片混合计算,Rust 运行时 + 定制 Metal kernel
- 实测:M5 Max 上 prefill +23%、decode +35%(对比 MLX-LM)
- 优化重点:减少推理过程中的数据搬运,而非单纯堆算力
行业意义
与“端侧模型”一脉相承:在云端推理成本与数据合规双重压力下,把推理下沉到本地成为一种务实选择,而优化的关键依然是内存与数据搬运。本地推理引擎的成熟,也让“数据不出本机”具备了工程可行性。