Skip to content

Project B Trace / Evaluation 方案 ​

目标:让 Multi-Agent Runtime 的每一步可解释、可审计、可回放。

Trace 关注点 ​

Trace 对象记录什么为什么重要
tasktask_id、类型、状态、创建者串起一次运行
role stepCoordinator / Analyst / Executor / Reviewer 的输入输出解释多角色协作
tool call工具名、参数、结果、错误、耗时排查工具执行
policy decisionallow / deny / approval_required证明工具治理
approval审批人、动作、参数摘要、结果HITL 可审计
audit eventactor、action、target、risk、timestamp合规与复盘
trajectory多 Agent 状态迁移和 handoff面试中可视化讲解

示例 Trajectory ​

stepactoractiongovernance
1Coordinator创建 multi_agent task记录 task_id
2Analyst分析运营问题并生成查询意图fake/offline LLM boundary
3Executor请求 ToolGateway 执行查询工具PolicyEngine 检查
4PolicyEngine判断写动作需要审批approval_required
5Human Approverapprove / reject / editaudit trail
6Reviewer汇总结果并检查风险reviewer verdict

Evaluation 关注点 ​

指标验证点
Orchestration correctness角色顺序、handoff、状态迁移是否符合预期
Tool governance未白名单工具是否被拒绝,高风险工具是否进入审批
Audit completeness关键动作是否都有 audit event
Trace completeness是否能从 task_id 找到完整 trajectory
Offline reproducibility默认测试是否不依赖真实 LLM 或外部 MCP

验证命令 ​

powershell
python -m pytest
python -m py_compile app/api/observability.py app/api/operations.py scripts/start_dev.py

Frontend:

powershell
cd frontend
npm run lint
npm run build