AI 产品经理 · Agent 评测方向

从 Agent 的每一步行为中,找到产品的下一步

我在豆包生产力 Agent 团队负责评测体系:把真实任务沉淀为 Benchmark,审计 Judge 的可信度,沿 Trace 定位失败,并把证据变成版本决策。

查看项目经历
陈乐
陈乐香港中文大学 · QS 18语言学硕士Benchmark · Judge · Trace · Decision
项目经历 · Project Experience

四个问题,
一条证据链。

四个案例沿同一条链路展开:从任务如何进入题库,到版本是否值得发布。点击任一步,直达对应案例。

核心问题 01BENCHMARK 构建

真实任务很多,
哪些样本能衡量能力?

题量不等于评测能力。一道题若所有模型都满分、或同一模型三次结果方向相反,它就不该进入发布题库。

Context
豆包生产力 Agent
Ownership
样本策略 · 难度设计 · 运行筛选 · 准出标准
Result
支撑日常回归与版本准出,通过 77Q 挑战集与 14Q 编辑难题持续探测能力边界、定位模型短板
Scope
离线评测 · 版本判断 · 跨团队交付

人工复核每道题的证据与评分标准,最终沉淀 77 道可持续回归的发布挑战题。

Representative · 代表性Discriminative · 区分度Reliable · 稳定性Verifiable · 可核验
回归基线稳定覆盖核心能力,作为版本准入的最低门槛。
边界挑战复杂附件、多工具协作与无解任务,探测能力边界。
线上错题本把线上负反馈复现成题,修复后持续回归,防止问题回潮。
NEXT题库有了区分度,下一个问题是:分数本身可信吗?
核心问题 02JUDGE 审计

Judge 可靠吗?

两套 Judge 对同一批模型给出不同排序,分差最大的模型相差 9.34 分。需要进一步判断是模型版本波动,还是裁判本身失效。

Context
豆包生产力 Agent
Ownership
分歧回查 · 文件级核验 · 失败归类 · 校准机制
Result
推动评测链路由 LLMAJ 迭代至 AAJ,并建立双 Judge、告警与人工仲裁机制
Scope
离线评测 · 版本判断 · 跨团队交付
Signal · 信号模型排序发生反转,分差最大达 9.34 分
Hypothesis · 假设是模型版本波动,还是裁判本身失效?
Audit · 审计回查分歧 Case 的真实产物与附件证据
Finding · 发现差异主要来自裁判读取证据的方式
模型AAJLLMAJΔ
CC87.1277.78+9.34
Kimi84.6483.52+1.12
Manus72.1175.99−3.88
MoA70.8067.33+3.47
审计之后双 Judge 互验异常自动告警人工仲裁版本结论可追溯
NEXT分数可信之后,还要回答失败发生在哪一步。
核心问题 03TRACE 归因

Agent 究竟在哪一步失败?

召回率只能回答有没有走对链路。进一步沿 Trace 找到第一个异常分叉点,才能区分根因和后续连锁反应。

Context
豆包生产力 Agent
Ownership
Trace 审计 · 首错定位 · 根因分类 · 修复验证
Result
推动主 Skill 召回率由 78% 提升至 87%,Reference Skill 提升 14%
Scope
离线评测 · 版本判断 · 跨团队交付
78% 87%主 Skill 召回率(定位首错并修复后)
FIRST FAILURE · 首个异常分叉Skill 选择主 Skill、Reference 与 Script 是否正确召回。
TRACE LOG · 脱敏q001 / spreadsheet chart
01需求理解02任务规划03Skill 选择04工具执行05观察与校验06证据与交付首个异常出现在「Skill 选择」;虚线为错误传播路径。
NEXT根因只有进入优先级与发布计划,才会产生产品价值。
核心问题 04版本决策

这组结果,能支持发布吗?

整体分数回答不了发布问题。决策要同时看核心链路是否改善、失败类型是否收敛,以及线上风险是否仍然存在。

Context
豆包生产力 Agent
Ownership
指标解读 · 风险门槛 · 回归计划 · 灰度验证
Result
形成拦截、暂缓、人工复核、灰度验证与通过五类发布建议
Scope
离线评测 · 版本判断 · 跨团队交付
主 Skill 召回率78%87%同一专项回归集
AAJ 人机一致率80%+局部维度最高 99%
已识别风险4 类全部进入专项回归
DECISION · 发布裁决

核心链路通过回归后灰度发布;文件级失败继续作为发布门槛拦截。

改善足以支撑灰度,风险仍需继续拦截。评测结论由此进入发布规则,并成为版本计划的一部分。

自动化流程 · Automation Pipeline

把批量评测跑成自动化流程

题目读取、批量发送、Trace 抓取、根因归纳与报告生成进入同一条链路,每个结论都可复核、可复现。下方为 Eval Analysis 的脱敏界面,可切换 Case 与证据视图。

Eval Analysis脱敏样例 · 单文件报告视图
平均得分0.49
低分题2
必需 Skill 召回66.7%
结果消费率50.0%
q001

根据销售明细生成趋势图,并交付可继续编辑的 Excel 文件。

0.00
01

必需 Skill 未召回任务需要 chart_generation,Trace 中只出现 format_cells

02

产物与回复不一致最终回复声称已完成图表,文件中没有对应 Chart Object

03

结果没有被交付工作簿已生成,但回复没有提供可访问的文件引用

01

Eval Analysis

离线评测复盘

把得分、失败 Rubric、预期 Skill 与真实 Trace 放在同一条证据链上,区分漏召回、参数错误、调用失败与结果未消费。

单文件 HTML 报告,结论可追溯
02

Case Analysis Pipeline

批量跑题与分析

串联题目读取、批量发送、Trace 抓取、根因归纳与报告生成,支持单 Case 恢复,避免临时命令与人工搬运。

一次配置完成批量评测
03

Trace Analysis

执行链路诊断

按 Span 树定位路由、规划、工具、上下文与交付环节的第一个异常分叉点,还原失败传播路径。

区分模型问题、工具失败与交付问题
04

Chart Badcase Workflow

Excel 图表专项审计

从候选题筛选、Prompt 还原到多轮产物审计,并在桌面 Excel 运行时验证图表结构与真实呈现。

覆盖数据、公式、图表与运行时证据
方法迁移与产品探索

把评测能力迁移到新的业务问题

从跨场景方法、评测 Agent 产品到行业业务方案,三类探索分别证明方法可迁移、能力可产品化、体系可落到具体业务目标。

跨场景评测方法

先定义产品承诺,再选择离线样本、线上信号、误判风险与 Judge 组合。

核心判断 · QUESTION

用户是否拿到可继续编辑、可直接使用的真实产物?

评测对象完整任务与最终文件
OFFLINE · 离线评测要点
  • 任务取自真实工单:冻结指令、输入文件与完成定义,不靠编题
  • 文件级核验:解析 xlsx / pptx 断言 Sheet、公式与格式,而非只看回复
  • Trace 归因:区分 Skill 漏召回、参数错误、调用失败、结果未消费
  • Pass³ 稳定性:同一任务连续 3 次成功才计通过,压住偶发成功
ONLINE · 线上信号
  • 产物下载 / 打开率:拿到文件不等于真正使用
  • 二次编辑率:在产物上继续修改的会话占比
  • 人工返工率:下载后重做或大改的比例
  • 同任务重复发起率:再提一次 = 首次未完成
RISK · 最容易误判的地方
  • 回复称“已完成”,文件却没生成或内容错误
  • 附件、公式、图表在生成链路中静默丢失
  • 单次跑通即报成功,掩盖版本不稳定

JUDGE 组合规则断言 + 文件解析 + Agent Judge + 人工仲裁

独立产品实践

AgentLens

面向 AI 产品、算法和 Evaluation 团队的 Agent 评测与发版决策平台。

可运行 MVP
产品问题

总分变高,不代表这个版本值得发布。

团队需要知道提升发生在哪项能力、退化由哪一步引起,以及风险是否已经触发发布门槛。AgentLens 将分散的评测、调试和决策动作收进同一条工作流。

01任务集定义能力与风险
02Agent 运行保留完整 Trace
03自动评测规则与 Judge 互补
04失败归因定位首个异常节点
05版本对比识别提升与退化
06发布建议Release / Hold / Block
AgentLens 基准评测界面
按能力切片查看通过、失败与阻塞 Case,并从汇总指标直接下钻到异常 Trace。
50 条中文演示任务覆盖 12 个能力切片与对抗场景
25 条Judge 校准集支持分歧查看与人工复核
6 模块完整产品闭环从 Benchmark 走到 Release Gate
我的 Ownership

独立完成用户问题定义、MVP 范围、信息架构、评测逻辑与前端实现。项目使用演示数据验证产品流程,不将模拟指标包装成真实业务收益。

独立方案 · 行业业务评测体系

1688 Agent Bench

为跨境采购任务定义“完成”:需求是否收敛、硬约束是否满足,用户能否继续询盘、比价或下单。本方案为独立项目,非业务数据。

用户能否继续推进采购

从采购目标出发,检查候选是否满足预算、起订量、交期与资质等硬约束,并判断用户能否继续询盘、比价或下单。

任务完成度用户能否继续推进采购,而不只是拿到一个回复
硬约束违规率预算、MOQ、交期、资质是否被严格满足
关键 Tool 正确率必要的查询与动作是否成功执行
Pass³同一任务连续三次均成功,才计入稳定通过
OFFLINE判断版本能不能发
ONLINE判断采购生意是否变好
论文研究 · Thesis Research

先定义测量对象,
再讨论分数。

语言学训练让我习惯把主观体验拆成可标注、可校准、可验证的构念:先明确测量什么,再设计标注规则,最后用一致性统计证明分数可信。这套方法同样支撑了剧本生成、AI 陪伴等场景的评测设计。

硕士论文 ·《话语显著性与汉语普通话中的宾语话题化》· 语料库 + LLM 研究

研究对象是宾语话题化这一非典型语序在真实话语中的自然度。先把主观语感拆成话语距离、对比性、跨句指代三个可独立标注的语境因素。构念需要清晰到两个人能按同一把尺子判断。

测量对象 · 真实话语中的语序接受度

基于真实问答语料构建 210 条样本的评测集:脚本 + LLM API 完成语料筛选、候选召回、语境抽取与自动预标注,再由两名标注员独立裁定、对分歧逐条复核,每条样本标注话语距离、对比性等语境维度。

210 条样本 · 双人独立标注 · LLM 预标注 + 人工裁定

用 Cohen's κ 检验两名标注员的独立标注结果(κ = 0.84,高度一致),证明分数反映的是语言现象而非个人语感;分歧样本回流修订标注手册,规则稳定后才进入统计环节。

Cohen's κ = 0.84 · 标注手册随分歧迭代

逻辑回归显示话语距离与对比性均显著影响语序接受度。双模型实验进一步验证:模型对局部关联敏感,但在跨句语境约束下稳定性不足。完整统计结果与模型版本记录在论文正文中。

话语距离 OR=6.825 · 对比性 OR=3.876 · 双模型对比

在用户需求、产品体验
与模型能力之间工作。

字节跳动豆包工作生产力 Agent 评测体系建设

传音控股AI 产品运营与多语言场景

Shopee用户反馈分析与产品落地

下载简历