Rohan Paul@rohanpaul_ai2026年9月24日 06:28新的 Google 论文显示,对于无服务器 CPU 上的小型量化 LLM,55-70% 的冷启动延迟只是模型加载。 即瓶颈通常是移动模型权重,而不是生成令牌。 与将模型存入内存相比,推理本身并不是什么问题。 为同一模型提供 8 GB 的 Cloud Run 内存(而不是 4 GB)可解锁大约 2 倍的 CPU,将热推理时间几乎减少一半。打开原帖#511482