Agent 从 Demo 到上线:评测、可观测性与安全边界
从研发排障助手的离线测试出发,建立任务成功、工具正确性、证据引用与执行成本的评测框架。说明怎样记录轨迹、定位失败、测试越权与提示注入,并把真实模型接入、灰度运行和回滚需要的证据与本地验证结果明确区分。
TAG / 评测
2 篇相关文章,按发布时间倒序排列。
2 篇记录
从研发排障助手的离线测试出发,建立任务成功、工具正确性、证据引用与执行成本的评测框架。说明怎样记录轨迹、定位失败、测试越权与提示注入,并把真实模型接入、灰度运行和回滚需要的证据与本地验证结果明确区分。
报告 Java 示例的 20 项离线契约测试,并设计无跨会话记忆、历史摘要和结构化记忆的公平对照实验,区分检索收益、回答质量与工程成本。