产业观察

Scale AI发布ROK-FORTRESS多语言AI安全基准研究结果

原标题: Scale AI Reports ROK-FORTRESS Findings on Multilingual AI Safety

unite.ai·2026/9/17 22:28:01🔗 原文

📋总体概括

Scale AI于2026年9月17日联合韩国AI安全研究院发布双语英韩对抗性安全基准ROK-FORTRESS的评估结果。该基准覆盖14个前沿大模型,采用「转写矩阵」设计,不是简单翻译英文提示词,而是基于韩国本土语境重新构造对抗性攻击。结果显示,几乎所有被测模型在韩语及韩国语境下的危害得分均低于英语,表明前沿模型的安全对齐在非英语语言和本地化语境中存在系统性薄弱环节,为多语言AI安全评估提供了新方法。

关键信息

  • Scale AI与韩国AI安全研究院联合发布双语英韩对抗安全基准ROK-FORTRESS,发布日期为2026年9月17日
  • 基准共评估14个前沿大模型的安全表现
  • 韩语提示词且嵌入韩国本土语境时,几乎所有模型测得的危害程度均一致偏低
  • 基准采用「转写矩阵」设计,针对韩国语境重写对抗提示,而非直译英文攻击
  • 结果揭示模型安全对齐在非英语语言环境下可能存在系统性盲区

🔥犀利点评

注意这里的解读陷阱:韩语测得危害低,未必是模型在韩语下更安全,更可能是攻击强度不够——现有模型的安全训练语料以英语为主,非英语攻击样本稀缺,反而让红队手段在韩语语境下施展不开。把「测不到危害」等同于「更安全」,是这个领域最常见的自欺。ROK-FORTRESS用本地化转写而非翻译来构造攻击,方向是对的,但14个模型整体表现趋同,恰恰暗示是测试方法的天花板而非模型的真实安全水位。多语言安全的真实差距,恐怕比这份报告呈现的更严重。

本文由本站自动聚合,以下为原始来源:前往 unite.ai 阅读全文