模型排行榜

Perplexity开源Lily推理引擎:Apple Silicon上快过MLX-LM

发布日期:2026-09-03

事件概述

Perplexity开源了Lily,一个面向Apple Silicon混合计算的本地推理引擎。它针对Qwen3.6-35B-A3B做了专门优化,把模型算子直接映射到硬件,用Rust运行时与自研Metal内核减少推理过程中的数据搬运。在M5 Max MacBook Pro上,其预填充吞吐比MLX-LM高1.23倍、解码吞吐高1.35倍。

核心要点

  • 定位:Apple Silicon专用本地推理引擎,走混合计算路线
  • 优化对象:专门针对Qwen3.6-35B-A3B这一MoE配置调优
  • 技术手段:Rust运行时 + 自研Metal内核,目标是压缩数据搬运开销
  • 实测:M5 Max MacBook Pro上预填充1.23倍、解码1.35倍于MLX-LM
  • 意义:开源,可直接对标社区默认方案

行业意义

端侧推理的工程优化正在从"能跑"转向"跑得快"。当同一个模型在不同引擎上能有20%-35%的吞吐差距时,选择什么运行时就和选择什么硬件一样重要了。

来源:HeadsUp AI · Biggest AI News September 2026

本站声明