Eval

模型在某项任务上的正确率是 60%、95%,还是 99.5%?Agent 的任务完成率有没有提升?一次 Prompt 调整到底带来了优化还是退步?这些问题背后,都离不开 Eval。

随着 AI 应用逐步进入生产环境,评测正在成为 AI 产品研发过程中不可缺少的一环。越来越多团队开始在开发产品的同时建设 Eval 体系,通过持续测试和反馈来验证模型、Agent 与业务流程的实际效果。

这个专题聚焦 AI 应用的评测与优化实践,内容涵盖 Eval 数据集构建、自动化 Eval、Agent 评测、线上监控、质量保障与持续优化等方向。

嘉宾将分享如何定义产品中的好结果,如何发现系统隐藏的问题,以及如何建立一套能够伴随产品持续迭代的评测机制。

对于很多 AI 团队来说,产品能力的上限可能由模型决定,但产品质量的下限往往由 Eval 决定。

一个完善的 Eval 体系,不仅能够帮助团队发现问题,更能够为每一次模型升级、Prompt 调整和系统重构提供可靠依据。

专题嘉宾

06 位嘉宾
出品人
张海立
专题内容策划与出品
张海立 · Ambassador · LangChain
内容评审
唐文桦
唐文桦
上海群蚁信息 · 总经理
刘赫伟
刘赫伟
华为 · 云业务技术规划部长
讲师
陈凤娇
具身智能要到 GPT 时刻,先解决泛化
陈凤娇 · 技术专家 · 美团
以大模型引领具身智能迈向GPT 时刻,已成为业界的重要技术方向。然而,要实现这一目标,首先需要清晰定义目标能力,并对演进路径中的关键里程碑进行科学度量。 本次分享将以泛化能力为主线,探讨具身智能的目标能力体系,并介绍一套多阶段、系统化的评测基准。在此基础上,我们进一步围绕人类数据预训练和具身世界模型展开研究,补齐相关评测能力的空白,以评测结果指导训练策略迭代...
讲师
冀昱衡
从成功率到过程诊断的机器人评测实践
冀昱衡 · 研究员 · 智源研究院
随着机器人任务变长、环境更复杂,仅用成功率已难以完整刻画模型能力。 本次分享将介绍 PRM,as,a,Judge 1.5 如何从任务描述与执行视频中估计连续进度曲线,并通过 OPD 过程评测体系分析任务推进、执行效率、回退恢复与成功质量。 结合主流榜单公开轨迹,我们进一步比较 VLA 与 WAM、模型规模及 Sim,to,Real 差异,并通过典型案例和开源...
讲师
周劲松
NVIDIA 的 AI Agent 开发与评测优化
周劲松 · 解决方案架构师 · NVIDIA
智能体 AI 正在从生成答案迈向能够理解上下文、规划任务、调用工具、验证结果并动态调整的复杂系统。 本次分享将介绍 NVIDIA 智能体开发与优化路径:通过 AI Blueprint 和 NeMo 构建企业级智能体,利用 NeMo RL 开展可扩展强化学习与持续对齐,借助 NeMo Gym 构建标准化、可验证的训练环境,并以 NeMo Relay 强化跨框架...

足够新鲜的思考、经验和判断。

9 月 12 日 · 上海浦东