SAIL: Redesigning Collaborative Language Inference with a Single Server-to-Mobile Handoff¶
跟笔者研究方向完全没关联,跳过
(1) 研究背景与痛点
-
困境:
- 在移动设备上运行小语言模型(SLM)响应速度快,但难以处理复杂的推理任务(准确率低)
- 将任务卸载到云端大语言模型(LLM)虽然准确率高,但会带来不可接受的高延迟
-
现有方案的局限性:
- 现有的云边协同推理方法(如模型分割计算、投机解码)在生成过程中需要频繁的网络同步与通信(O(n)次网络往返)
- 这在移动网络环境下会累积巨大的延迟,抵消了算力带来的优势
(2) 解法: SAIL
- 让服务器端的LLM生成较难的 "早期Token"(前缀)
- 将前缀一次性发送给移动端
- 由移动端的SLM独立完成剩余的 "简单Token"(后缀) 生成