Berkeley AI Research·· 2026-07-26AI 评分32
ABBEL:通过信念状态监督让 LLM 高效完成长程交互
Teaching LLMs to Update Beliefs for Efficient Long-Horizon Interaction
AI 导读
伯克利 AI 研究提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,用类似自编码器的重建评分作为奖励。在协作编程基准 CollabBench 上,ABBEL-rec-BG 将上下文摘要模型与全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值 token 用量也低于全上下文方案。
来源:Berkeley AI Research · bair.berkeley.edu