Distill Globally, Adapt Locally: Reasoning Distillation and Product-Type Test-Time Training for Scalable Trade-Up Recommendation
本文提出一种两级框架,将大语言模型推理蒸馏至高效非生成学生模型并适配产品类型特定标准。一级中,检索增强少样本 LLM 教师生成结构化标签与理由,监督紧凑嵌入对分类器;推理时仅使用两个预计算 768 维嵌入,无需调用 LLM 或文本生成。在 8,352 对人标注基准上,15.5M 参数四分类推理蒸馏学生 AUC 达 0.924,优于仅标签学生的 0.912。二级采用产品类型测试时训练(PT-TTT),利用少样本演示优化轻量级类别特定适配器,使 AUC 从 0.924 提升至 0.941,平均精度从 0.920 升至 0.940。在 10 万对代理目录上,单台八 GPU 机器运行蒸馏学生速度约为直接 LLM 推理的 5,000 倍,预估成本降低 10,000 倍。