Perplexity
@perplexity_ai
Perplexity **开源 Lily**,这是支撑 Perplexity Computer 混合计算(hybrid compute)的本地推理引擎。
- 专为 **Apple 芯片**上的 **Qwen3.6-35B-A3B** 优化,避免本机步骤拖慢 Computer 任务。
- 采用定制 Rust + Metal 栈(执行路径不含 PyTorch/MLX),分别优化 prefill 与 decode。
- 在 M5 Max MacBook Pro 上,跨十组长度(256–128K)平均相对 MLX-LM 实现 **1.23×** prefill、**1.35×** decode 吞吐,输出质量基本不变。
- 代码已放在 GitHub(`perplexityai/pplx-garden` / Lily);工程博客详述优化细节。
来源为 Perplexity 官方工程博客 + @perplexity_ai 公告线程。