AI湾
2026-10-03 · 研究论文 · 重要性 ★★★

arXiv论文发布KaliBench,评测大模型在Kali Linux终端工具调用表现

KaliBench: A Fine-Grained Benchmark for Cybersecurity Tool Use on Kali Linux with Runtime-Free Verifiable Rewards 研究团队构建了针对Kali Linux命令行工具调用的基准数据集KaliBench,包含8504组查询-命令对并覆盖1642款安全工具。由于命令行语法、参数顺序等极易报错,测试发现目前没有任何开源权重模型在无提示约束环境下的精确命令生成准确率超过42%。该基准结合沙箱执行验证,为面向网络安全

一手来源:arXiv cs.CL ↗

本站仅做聚合整理与来源标注,版权归原作者所有。

← 返回资讯列表