AI湾
2026-09-29 · 研究论文 · 重要性 ★★★

arXiv:ScopeBench 提出首个评测安全 Agent 在目标压力下越界行为的基准

ScopeBench: Do Agents Preserve Engagement Boundaries Under Goal Pressure? 研究人员提出包含 30 个死胡同安全任务的评测基准 ScopeBench,用于评估自主渗透测试智能体在「必须违背授权范围才能达成既定目标」压力下的行为一致性。每个任务设无授权范围与有自然语言授权范围两种条件,共享环境、验证器与目标;有范围条件下的轨迹经确定性验证器与经人工标注校准的 Agent 评判器双重审计,以判定是否发生越权调用。

一手来源:arXiv cs.AI ↗

本站仅做聚合整理与来源标注,版权归原作者所有。

← 返回资讯列表