真实任务很多,
哪些样本能衡量能力?
题量不等于评测能力。一道题若所有模型都满分、或同一模型三次结果方向相反,它就不该进入发布题库。
人工复核每道题的证据与评分标准,最终沉淀 77 道可持续回归的发布挑战题。
我在豆包生产力 Agent 团队负责评测体系:把真实任务沉淀为 Benchmark,审计 Judge 的可信度,沿 Trace 定位失败,并把证据变成版本决策。

四个案例沿同一条链路展开:从任务如何进入题库,到版本是否值得发布。点击任一步,直达对应案例。
题量不等于评测能力。一道题若所有模型都满分、或同一模型三次结果方向相反,它就不该进入发布题库。
人工复核每道题的证据与评分标准,最终沉淀 77 道可持续回归的发布挑战题。
两套 Judge 对同一批模型给出不同排序,分差最大的模型相差 9.34 分。需要进一步判断是模型版本波动,还是裁判本身失效。
| 模型 | AAJ | LLMAJ | Δ |
|---|---|---|---|
| CC | 87.12 | 77.78 | +9.34 |
| Kimi | 84.64 | 83.52 | +1.12 |
| Manus | 72.11 | 75.99 | −3.88 |
| MoA | 70.80 | 67.33 | +3.47 |
召回率只能回答有没有走对链路。进一步沿 Trace 找到第一个异常分叉点,才能区分根因和后续连锁反应。
整体分数回答不了发布问题。决策要同时看核心链路是否改善、失败类型是否收敛,以及线上风险是否仍然存在。
改善足以支撑灰度,风险仍需继续拦截。评测结论由此进入发布规则,并成为版本计划的一部分。
题目读取、批量发送、Trace 抓取、根因归纳与报告生成进入同一条链路,每个结论都可复核、可复现。下方为 Eval Analysis 的脱敏界面,可切换 Case 与证据视图。
必需 Skill 未召回任务需要 chart_generation,Trace 中只出现 format_cells
产物与回复不一致最终回复声称已完成图表,文件中没有对应 Chart Object
结果没有被交付工作簿已生成,但回复没有提供可访问的文件引用
把得分、失败 Rubric、预期 Skill 与真实 Trace 放在同一条证据链上,区分漏召回、参数错误、调用失败与结果未消费。
单文件 HTML 报告,结论可追溯串联题目读取、批量发送、Trace 抓取、根因归纳与报告生成,支持单 Case 恢复,避免临时命令与人工搬运。
一次配置完成批量评测按 Span 树定位路由、规划、工具、上下文与交付环节的第一个异常分叉点,还原失败传播路径。
区分模型问题、工具失败与交付问题从候选题筛选、Prompt 还原到多轮产物审计,并在桌面 Excel 运行时验证图表结构与真实呈现。
覆盖数据、公式、图表与运行时证据从跨场景方法、评测 Agent 产品到行业业务方案,三类探索分别证明方法可迁移、能力可产品化、体系可落到具体业务目标。
先定义产品承诺,再选择离线样本、线上信号、误判风险与 Judge 组合。
JUDGE 组合规则断言 + 文件解析 + Agent Judge + 人工仲裁
面向 AI 产品、算法和 Evaluation 团队的 Agent 评测与发版决策平台。
团队需要知道提升发生在哪项能力、退化由哪一步引起,以及风险是否已经触发发布门槛。AgentLens 将分散的评测、调试和决策动作收进同一条工作流。

为跨境采购任务定义“完成”:需求是否收敛、硬约束是否满足,用户能否继续询盘、比价或下单。本方案为独立项目,非业务数据。
从采购目标出发,检查候选是否满足预算、起订量、交期与资质等硬约束,并判断用户能否继续询盘、比价或下单。
语言学训练让我习惯把主观体验拆成可标注、可校准、可验证的构念:先明确测量什么,再设计标注规则,最后用一致性统计证明分数可信。这套方法同样支撑了剧本生成、AI 陪伴等场景的评测设计。
硕士论文 ·《话语显著性与汉语普通话中的宾语话题化》· 语料库 + LLM 研究研究对象是宾语话题化这一非典型语序在真实话语中的自然度。先把主观语感拆成话语距离、对比性、跨句指代三个可独立标注的语境因素。构念需要清晰到两个人能按同一把尺子判断。
测量对象 · 真实话语中的语序接受度基于真实问答语料构建 210 条样本的评测集:脚本 + LLM API 完成语料筛选、候选召回、语境抽取与自动预标注,再由两名标注员独立裁定、对分歧逐条复核,每条样本标注话语距离、对比性等语境维度。
210 条样本 · 双人独立标注 · LLM 预标注 + 人工裁定用 Cohen's κ 检验两名标注员的独立标注结果(κ = 0.84,高度一致),证明分数反映的是语言现象而非个人语感;分歧样本回流修订标注手册,规则稳定后才进入统计环节。
Cohen's κ = 0.84 · 标注手册随分歧迭代逻辑回归显示话语距离与对比性均显著影响语序接受度。双模型实验进一步验证:模型对局部关联敏感,但在跨句语境约束下稳定性不足。完整统计结果与模型版本记录在论文正文中。
话语距离 OR=6.825 · 对比性 OR=3.876 · 双模型对比字节跳动豆包工作生产力 Agent 评测体系建设
传音控股AI 产品运营与多语言场景
Shopee用户反馈分析与产品落地