模型排行榜

Perplexity开源Lily推理引擎,面向苹果芯片优化

发布日期:2026-09-15

事件概述

Perplexity 开源了面向苹果芯片的本地推理引擎 Lily,专门针对 Qwen3.6-35B-A3B 优化,把模型运算直接映射到硬件;在 M5 Max MacBook Pro 上,prefill 吞吐比 MLX-LM 高 1.23 倍、decode 吞吐高 1.35 倍。引擎使用 Rust 运行时与定制 Metal kernel,目标是最大限度减少推理过程中的数据搬运。

核心要点

  • 路径:苹果芯片混合计算,Rust 运行时 + 定制 Metal kernel
  • 实测:M5 Max 上 prefill +23%、decode +35%(对比 MLX-LM)
  • 优化重点:减少推理过程中的数据搬运,而非单纯堆算力

行业意义

与“端侧模型”一脉相承:在云端推理成本与数据合规双重压力下,把推理下沉到本地成为一种务实选择,而优化的关键依然是内存与数据搬运。本地推理引擎的成熟,也让“数据不出本机”具备了工程可行性。

来源:HeadsUpAI(2026年9月)

本站声明