← 全部项目02 / 05

AGENT TOOL USE

Agent
工具调用评测

在 AI 相机与 Chat 融合场景中,核验模型调用的工具是否符合用户真实任务。

用户意图匹配工具选择与需求对应异常与高风险问题识别
范晨 · AI 训练师阿里巴巴集团任职期间 · 项目经理
每日线上巡检
01 / CONTEXT

项目背景

输入同时覆盖图片和文本,需要结合用户需求与任务目标判断 Agent 的实际工具调用是否匹配用户意图。

EVALUATION FOCUS

从“调用了工具”,回到“完成什么任务”。

结合图片、文本与用户目标判断工具选择是否匹配。对不符合预期的调用记录具体差异,再将异常样本交给算法团队定位与修复。

02 / MY ROLE

我的职责

  1. 01

    评测用户需求与 Agent 工具调用之间的匹配关系。

  2. 02

    核对工具调用结果,检查工具选择是否与需求对应。

  3. 03

    开展每日线上巡检,将异常及高风险问题样本反馈算法团队,协同定位与修复。

03 / PROCESS

从判断到交付

  1. 01

    理解任务

    结合图片类、文本类输入以及用户希望完成的任务,确定评测目标。

  2. 02

    核验工具选择

    核对模型实际调用的工具及调用结果,判断是否与用户需求对应。

  3. 03

    记录不匹配

    对不符合预期的样本记录问题表现和判定理由,形成可复核的评测记录。

  4. 04

    线上巡检与协作

    每日识别调用链路中的异常及高风险问题,整理样本并反馈算法团队,协同推进定位与修复。

04 / DELIVERY

交付与成果

形成可用于复核和问题定位的记录,支持工具调用链路优化。

  • 工具调用匹配评测记录
  • 异常及高风险问题样本
  • 面向算法团队的问题反馈