我们如何用 DSPy 将 AI 评估转化为 Dash 聊天的更好回答

Dropbox 的 AI 功能把文档、消息、会议等来源中的企业知识汇集起来,让用户在一个地方提问,并获得 Dash 聊天代理的回答。我们使用一组“大语言模型担任裁判”的评估,衡量聊天代理帮助用户达成目标的能力。这些评估既能衡量代理表现,也能找出改进机会。

评估不只判断最终回答,而是检查代理满足用户目标的完整轨迹:如何理解意图、收集上下文、使用工具、处理歧义、为回答提供依据,以及完成任务。

我们把代理评估作为改善聊天代理的基础。这些评估驱动裁判,依据代理可获取的上下文衡量聊天结果,包括相关性、推理质量、证据使用、稳健性、任务完成情况,以及与用户要求的一致性。有了这个基础,我们再使用 DSPy 把评估转化为改进。DSPy 是利用评估反馈优化 AI 系统的开源框架。

我们分两个阶段应用 DSPy 及其优化算法。先用少量人工标注样例校准裁判,让评分更接近人类判断;再用改进后的裁判优化聊天代理的系统提示词。由此形成反馈循环:人工标注改善裁判,裁判提供可规模化的评估信号,评估信号再改善代理。

结果是用户遇到的不完整回答明显减少,我们也降低了 token 用量,同时没有牺牲回答质量。

本文介绍评估层的配置、用人工标签校准裁判、应用 DSPy 及 GEPA、MIPROv2 等优化算法改善裁判表现,以及利用这些裁判优化聊天代理本身。

Dash chat 评估与优化流程
原文流程图:评估与优化的反馈循环。

代理评估隐藏的复杂性

代理评估比传统搜索相关性评估复杂得多,因为被判断的对象不再是单个孤立输出,而是一个多步骤过程的结果。代理必须理解用户意图、收集上下文,决定何时以及如何使用工具。它还要综合多个来源的信息,再决定直接回答、继续搜索、总结发现,还是请求澄清。

评估范围因此大幅扩大。一条优质回答可能依赖文档、先前消息、会议笔记,以及搜索、读取文档等工具调用。最终回答的质量,不只取决于找到什么信息,还取决于代理处理任务的方法。

代理交互也可能跨越多轮。系统可能需要澄清模糊请求、吸收用户反馈、修订回答,或随着任务演变继续搜索。因此,评估不能只关注最终回答,还必须判断通向回答的决策。

代理由多个相互作用的组件构成,每个环节都需要各自的评估。我们不仅要评估回答质量,还要评估意图理解、工具使用、上下文选择、信息综合、证据依据、逐轮适应,以及整体任务完成情况。分别评估这些维度,有助于定位失败并更有效地改善底层组件。

由此出现一个重要问题:在用评估改善聊天体验之前,我们首先必须确保裁判本身可靠。

用人工标签校准裁判

评估聊天回答,需要能够结合用户意图判断回答的 LLM 裁判。可信赖这些裁判之前,我们必须确认它们的评估与人类判断一致。因此,我们从少量人工标注样例和工程师能够一致执行的评估量表开始。

我们抽样内部聊天,纳入最终回答与展示代理如何得出回答的追踪日志,再请人工评估者从五个维度审查每个样例:遵循用户意图、语义相关性(回答是否妥善回应用户请求)、工具调用、指令遵循,以及上下文选择。这些维度共同反映聊天代理的价值。

它们衡量代理是否理解用户目标、收集正确上下文、有效使用工具、遵循指令,并最终给出有依据、有帮助的回答。

为保持评估一致,评估者遵循结构化审查流程。先确定代理是否理解用户意图并选择正确上下文,再审查搜索、检索及其他信息收集工具操作,然后检查最终回答中的主张是否得到选定证据支持,最后对相关性、依据、完整性和指令遵循评分。

若干指标采用 1–5 分量表。评估者还记录解释评分的推理笔记,并为证据过时、上下文缺失、主张无依据、覆盖不完整、未能个性化等问题分配失败代码。推理笔记说明回答为何成功或失败,失败代码则以结构化方式归类反复出现的问题。

这些更丰富的监督信息非常有价值。评分提供有用的总结,但推理笔记与失败代码能揭示哪里出了什么问题:误解意图、选错上下文、工具决策不佳、漏掉指令,或回答仅部分相关。它们不仅提供回答质量信号,也揭示失败的底层原因。

标注可以优化裁判提示词,尽量减少 LLM 裁判与人工标注者的分歧,也能服务于调试、错误分析、路线规划,以及代理系统改进的优先级排序。最重要的是,它们提供可靠基准,使我们能够衡量并改善裁判本身。

从评估代理到改善代理

量表和标注数据准备好后,我们开始改善裁判。目标是在保留结构化评估流程的同时,让裁判与人工评估者更加一致。这需要的不只是通用评分提示词。

裁判需要遵循具体流程,事后回顾已结束的聊天轨迹:推断用户意图、检查对话、审查追踪与支持证据、分析上下文选择和工具使用,然后给出评分、失败代码与推理笔记。

我们使用 DSPy 及 GEPA、MIPROv2 等优化算法改善裁判表现。可以把 DSPy 看作工具箱,GEPA 和 MIPROv2 是其中的具体算法。算法自动提出提示词修改,再用人工标注样例测试,寻找有效改进。

我们支持多种优化策略:有时允许 DSPy 从头改写裁判指令;有时让现有裁判适配另一种底层模型,同时保持相同评估行为;也支持定向优化,只纠正某些失败模式,例如对过时信息评分过高,或低估上下文缺失的重要性,而不改变整体量表和评估流程。

无论采用哪种策略,我们都同时依赖人工评分和文本反馈。评分告诉我们裁判何时与人类意见不一致,反馈解释原因。例如,如果裁判总给依赖过时信息的回答高分,我们可以更新指令,让它更好地识别并惩罚这种失败模式。

当裁判能够可靠地反映人工判断后,我们就能用它们作为改善代理本身的基础。

过去,聊天代理的提示词优化主要靠人工。工程师审查失败、提出修改、测试并迭代。这能改善个别案例,却难以规模化,也难以确定修改能否可靠地提高生产质量。我们用自动化、评估驱动的循环替代了这一流程,其基础是标注样例、与生产环境一致的评分器,以及离线反事实重放。

每一轮 GEPA 都把候选提示词用于重放有代表性的历史 Dropbox 内部聊天,再由评估流水线为所得代理输出评分。评分与结构化裁判推理共同成为 GEPA 提出下一次提示词更新的反馈信号。

这样,提示词优化以真实代理行为为依据,而非抽象示例或临时判断。用于诊断生产失败的同一套重放基础设施,现在也成为优化循环的一部分;每个候选方案在考虑上线前,都先接受代表性交互评估。优化针对具体失败模式,包括上下文选择错误、回答不完整、遗漏歧义、搜索工具使用不当,以及丢失多轮上下文。

由此形成更紧密的反馈循环:重放代表性样例,用与生产环境一致的评估者评分,以评分指导下一次 GEPA 提议,不断重复,直到数据支持一个可上线的候选方案。

更快的迭代与更好的质量

为了衡量提示词优化的影响,我们关注与语义相关性及回答质量有关的失败模式。语义相关性衡量代理是否理解请求并回应其中正确的部分;回答质量衡量回答是否完整、有用、有依据且结构良好。实际跟踪的问题包括回答不完整、遗漏请求的关键方面。

对每个新提示词,我们用同一组样例比较其与现有生产提示词的表现。这提供更公平的同条件比较,让我们更容易判断提示词修改是否确实改善表现。我们也检查收益是否具有统计意义。

统计检验用于判断观察到的改进是否可能反映真实变化,而非评估结果的随机波动。优化循环提高了实验速度:头两周自动生成六个候选提示词,前一个月人工只修改了五次,探索速度接近翻倍。

上线结果可以量化:不完整回答减少 26%,遗漏关键方面减少 13%,改进在头 24 小时内就显现。优化后的代理也更高效:总 token 用量下降 5.4%,平均生成回答长度下降 9.8%。这些效率收益没有以降低回答质量为代价。

这些结果共同说明,代理评估与 DSPy 能形成实用的行为改进反馈循环:识别失败模式、生成候选提示词、验证质量收益,并降低服务成本。

下一步

这项工作的重要经验之一是,自动提示词优化需要强有力的边界约束。我们有意将多数代理提示词修改限制为小规模、定向的指令更新,并对提示词结构、完整性、缓存行为和大小限制添加自动审查。随着优化过程日益自动化,这些保障帮助候选提示词保持可维护性,并适合生产环境。

更广泛地说,这次实验表明,提示词优化将传统机器学习的严谨方法引入提示词工程。结合人工标注评估、代表性重放数据,以及 DSPy 中基于 GEPA 的优化后,我们把提示词视为可衡量、可优化的产物,而非静态指令。

这一框架让我们系统地搜索影响模型行为的指令、约束、示例与策略,超越直觉和人工迭代,在上线前识别失败模式、比较改进并验证效果。

长期来看,代理优化可能越来越像持续的机器学习流程,而非人工提示词迭代:重放代表性数据、运行优化作业、用评估数据集比较候选方案、审查证据,再发布验证过的改进。与传统机器学习系统一样,弱评估信号可能带来脆弱的改进;强评估、代表性数据和专家审查则帮助变更泛化,并控制回归。

更广泛的经验是,代理优化在自动化与严谨评估相结合时效果最佳。可靠裁判、代表性重放数据和明确成功指标,构成改善代理行为所需的反馈循环,使质量可衡量、回归可控制。

致谢:Jongmin Baek、Josh Wilson、Akshay Bapat、Gonzalo Garcia、April Liu、Eric Wang、Hans Sayyadi、Prasang Upadhyaya,以及 Emeka Okafor Jr.。我们也感谢 DSPy 社区的参与与支持。将 DSPy 应用于 Dropbox 真实生产系统时,DSPy 合作者提供了指导、讨论和及时回应。

如果你热衷于构建创新产品、体验和基础设施,欢迎加入我们共同创造未来。空缺职位见 jobs.dropbox.com。

来源与版权

作者 Simran Jumani、Dmitriy Meyerzon;原文 How we used DSPy to turn AI evaluations into better responses in Dash chat,2026 年 6 月 25 日,Dropbox.Tech。本中文版本依据转载授权翻译。性能数字属于原文报告,未独立复现实验。

© 版权声明
THE END
喜欢就支持一下吧
点赞0 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容