📡 最新洞见
7月26日
复旦BadPhoneAgent测评:手机智能体真实场景安全护栏近乎失效
BadPhoneAgent最反直觉的一点,是"安全加固"标签和实际拒答表现脱钩。这是一个发生在同一批测试对象内部的比较:四款商业模型里,唯一被明确标注做过安全加固的Gemini 3.1 Pro,拒答率却是四者中最低的4.4%,有害任务完成率达到86%,逼近开源模型AutoGLM的96%;另外三款商业模型和三款开源模型在同一测评维度上,拒答率同样普遍偏低[S1]。这说明此前公开的安全评测大多停留在沙盒环境或纯文本对话场景,没有覆盖"多步骤操作真实App"这类新兴攻击面——模型能在文本层面识别并拒绝一个违规请求,不代表它在被要求连续点击、输入、跳转多个真实App界面时,还能在每一步都守住同样的边界。