跳转至

SAIL: Redesigning Collaborative Language Inference with a Single Server-to-Mobile Handoff

跟笔者研究方向完全没关联,跳过

(1) 研究背景与痛点

  • 困境:

    • 在移动设备上运行小语言模型(SLM)响应速度快,但难以处理复杂的推理任务(准确率低)
    • 将任务卸载到云端大语言模型(LLM)虽然准确率高,但会带来不可接受的高延迟
  • 现有方案的局限性:

    • 现有的云边协同推理方法(如模型分割计算、投机解码)在生成过程中需要频繁的网络同步与通信(O(n)次网络往返)
    • 这在移动网络环境下会累积巨大的延迟,抵消了算力带来的优势

(2) 解法: SAIL

  1. 服务器端的LLM生成较难的 "早期Token"(前缀)
  2. 将前缀一次性发送给移动端
  3. 移动端的SLM独立完成剩余的 "简单Token"(后缀) 生成