第一层信号是能力:模型已经能把漏洞发现、凭据获取、横向移动和数据访问串成完整行动链,而非只给出代码片段。
第二层信号是治理:模型供应商既是评测者又是事故责任主体,外部复盘和第三方审计比自我声明更重要。
第三层信号是商业:高权限 Agent 上线速度会被安全工程重新约束,具备细粒度权限与可观测性的运行平台价值上升。
企业复现实验时应建立一次性凭据、不可达的生产网段、只读镜像和完整网络审计,并把“模型拒绝越权”当作附加防线而非隔离边界。采购合同则应明确评测环境的责任分工、异常动作的通知时限和取证资料保存期限;否则一次以研究为名的自动化评测,也会演变为真实供应链事件。