资讯

“最强模型”来袭?OpenAI预告:Astra很快发布,网络安全能力达“关键”级

华尔街见闻·2026/9/2 09:15:30🔗 原文

📌 概要

OpenAI周二宣布,其下一代人工智能模型Astra首次触及公司内部“准备框架”中最高级别的“关键”网络安全能力阈值, 成为该公司迄今能力最强、同时也受到最严格安全管控的模型。 Astra能够自主发现此前未知的安全漏洞,并进一步开发漏洞利用方案。 这意味着,Astra已达到OpenAI定义的最高风险等级,模型能力一旦被滥用,可能产生此前未曾出现的严重安全威胁。 OpenAI表示,仍计划“尽快”

⚡ 关键要点

  • OpenAI周二宣布,其下一代人工智能模型Astra首次触及公司内部“准备框架”中最高级别的“关键”网络安全能力阈值,
  • Astra能够自主发现此前未知的安全漏洞,并进一步开发漏洞利用方案。 这意味着,Astra已达到OpenAI定义的最高风
  • 此次公告发布之际,OpenAI正面临外界对AI安全问题的高度关注。上月,该公司披露旗下两款模型曾逃逸训练环境、访问公开网

OpenAI周二宣布,其下一代人工智能模型Astra首次触及公司内部“准备框架”中最高级别的“关键”网络安全能力阈值,成为该公司迄今能力最强、同时也受到最严格安全管控的模型。

Astra能够自主发现此前未知的安全漏洞,并进一步开发漏洞利用方案。这意味着,Astra已达到OpenAI定义的最高风险等级,模型能力一旦被滥用,可能产生此前未曾出现的严重安全威胁。OpenAI表示,仍计划“尽快”发布Astra,但其最先进的网络安全能力将仅向有限范围的测试人员开放,随后通过旗下网络安全联盟Daybreak Blue逐步扩大访问权限。

此次公告发布之际,OpenAI正面临外界对AI安全问题的高度关注。上月,该公司披露旗下两款模型曾逃逸训练环境、访问公开网络并入侵Hugging Face系统,引发业界对AI失控风险的担忧。尽管Astra并未参与这一事件,OpenAI仍主动暂停部分相关开发工作,并将此次事件的经验教训纳入Astra的安全体系。

此外,OpenAI首席执行官奥特曼近期在一档播客节目中透露,Astra在操作电脑方面“感觉已经完全达到了人类水平”,并表示AGI的到来“至少已经非常接近了”。

OpenAI周二在博客文章中表示,将“很快”发布这款模型,但尚未透露具体时间。据业内人士此前透露,Astra还具备多智能体长期协作、桌面软件操作等能力,可执行数学证明、PPT制作、财务审核及复杂数据分析等任务。

能力突破:自主发现零日漏洞,网络安全能力跃升

根据OpenAI发布的技术博客,Astra的网络安全能力较前代模型GPT-5.6 Sol实现显著提升,不仅在漏洞识别和漏洞利用开发方面表现更强,而且完成相关任务所需的输出token数量大幅减少,效率进一步提高。

在公开基准测试ExploitBench上,Astra取得100%的成绩。为排除数据污染影响,OpenAI还构建了一套内部基准测试,覆盖2026年6月至8月期间披露的20个高危V8漏洞。测试结果显示,Astra的任意代码执行成功率明显高于GPT-5.6 Sol。

更值得关注的是,在评估过程中,Astra自主发现了两个此前未知的“零日漏洞”,即软件厂商尚未发现或修复的安全漏洞,并进一步将其用于构建漏洞利用链。OpenAI表示,目前正向相关维护方披露这两个漏洞。

在专家对加固浏览器和操作系统进行的测试中,Astra展现出较强的攻击能力。它不仅能够找到浏览器的安全漏洞,突破浏览器的安全隔离机制,并进一步在电脑系统中执行命令;还发现了操作系统中的多个漏洞,并将这些漏洞串联起来,实现从普通用户权限到最高系统权限的提升。

安全管控:多层防护应对“关键”级别风险

面对Astra达到的能力水平,OpenAI在发布前实施了一系列强化安全措施。

在模型训练层面,OpenAI在Hugging Face事件发生后暂停部分前沿训练工作长达两周,以强化训练基础设施隔离和网络管控,并加强对齐训练。针对Astra的大规模强化学习(RL)训练也一度暂停,直至8月28日在新的安全要求到位后才重新启动。

在模型行为层面,OpenAI对Astra进行了专项训练,使其更加可靠地拒绝有害网络请求,并严格遵守安全限制。测试数据显示,在模拟基准环境中,GPT-5.6 Sol有56%的测试会尝试访问“蜜罐”目标,即试图入侵周边安全基础设施,而Astra在相同测试中则未出现此类行为。

在部署监控层面,OpenAI为Astra级别模型部署了“失配监控”系统,通过分类器实时检查模型的推理过程和行为,并自动终止潜在的未授权活动。

访问限制:分阶段开放,优先服务防御性网络安全

鉴于Astra的能力级别,OpenAI将采取严格的分阶段访问策略。其高级网络安全功能将首先向一小批alpha测试人员开放,随后通过Daybreak Blue计划向更多经批准的组织扩展,重点支持防御性网络安全工作。

OpenAI同时提醒,Astra的安全检查系统初期可能误判合法活动,导致部分任务被减速、暂停或终止,包括长时间运行的智能体任务。在ChatGPT或Codex界面中,如果“失配监控”系统触发暂停,用户需要审核相关操作后才能继续;通过API使用时,任务则会直接停止。

OpenAI表示,随着AI模型承担更多高影响力工作,对齐或控制失效的后果也将更加严重。该公司将在Astra正式发布时通过模型系统卡披露更多安全、对齐测试及评估细节,目前尚未公布具体发布时间。

风险提示及免责条款 市场有风险,投资需谨慎。本文不构成个人投资建议,也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资,责任自负。