OpenAI近期公开了关于下一代模型 Astra 的技术信息,并在多处提到其能力已达到“网络安全关键级(Cyber-Critical)”。结合公开材料,本文把这次发布里能确认的重点梳理出来,顺便解释它为何迟迟未到位、又靠什么做安全控制。
为什么现在公开:能力到门槛,但安全成本也同步上升
根据公开说法,Astra之所以被放出来,关键在于它已进入“网络安全关键级”能力门槛。这个等级强调的是:在获得相应工具与环境权限后,模型能更自主地完成漏洞发现与利用相关任务,而不必每一步都由人类手工指引。
同时,相关材料也提到:对Astra的担忧并不是“能力不够”,而是能力一旦落在不当场景里,可能带来更高的滥用风险。因此,围绕安全、对齐与限制策略的工作在发布前后都被反复提到。
漏洞利用成绩与内部测试要点:成功率、难题与用更少Token
公开材料给出的一个直观指标是:在 ExploitBench 这类公开漏洞利用基准上,Astra获得了 100%的成功率。此外,团队还提到他们在内部测试中临时准备了一套新题,用来验证模型在相关截止时间之后是否还能应对新漏洞。

更关键的是,公开内容强调这些内部题目覆盖了在知识截止日期之后披露的高危漏洞,并据此降低“靠记忆背答案”的可能。结果方面,材料声称:Astra在这套新题上相对GPT-5.6 Sol 仍显著领先,且使用的 Token更少。
参与研发的研究员在公开引述里也给出了更直接的对比表达:在一项内部测试中,Astra的网络安全能力约为GPT-5.6 Sol的4倍。

除了“能不能做”,公开材料还提到一个更让人关注的点:在某次测试中,Astra能够 自主发现并利用两个零日漏洞,并把它们串成完整的攻击链。材料描述的链路包含从浏览器相关环境出发、逃出沙箱并在宿主执行命令;以及在操作系统加固情境下完成本地提权拿到更高权限。
这里也有明确限定:公开叙述指出,测试环境给了Astra更高级别的工具与环境权限,不能直接等同于“普通用户拿到的默认版本都具备同等攻击条件”。同时,相关结果以OpenAI内部评估为主,第三方验证仍有待时间确认。
一旦这样的能力被用于防守,可能帮助安全团队更快发现与修复未知漏洞;但若落入攻击者手中,也可能降低复杂网络攻击的门槛。

两道安全闸门:防恶意滥用,也防模型自行跑偏
公开材料把安全控制拆成两条风险路径:一条针对人(防止用户把模型用于恶意用途);另一条针对模型自身(防止模型在没有恶意意图的情况下,扩大战斗范围或绕过授权边界)。
闸门一:拒绝危险请求 + 持续监控任务行为
在“防人”的部分,材料提到系统会配合安全训练,并结合分类器、持续监控与威胁检测,识别多轮对话或长任务中的可疑操作。公开数字中给出过对比:在网络安全越狱测试里,Astra对危险请求的拒绝率为 91.5%,GPT-5.6 Sol为 59%。

此外,材料还说明高级网络安全能力并不会直接向所有用户开放:会先在小范围Alpha测试者中进行,再通过受控项目逐步释放(文中提到Daybreak Blue等受控项目的概念)。
闸门二:蜜罐测试 + 推理过程审查(减速/暂停/终止)
针对“防模型跑偏”,公开材料提到一种“蜜罐(honeypot)”测试思路:测试环境会故意留出越权“捷径”。如果模型会为了完成任务而试图绕过授权边界,就能在测试阶段被识别出来。
材料给出的对比说法是:在相关测试中,GPT-5.6 Sol曾在一部分场景里尝试走捷径,而Astra则一次也没有。还有一项测试提到:当Astra的危险命令被自动审查系统拒绝后,同样没有重试或尝试绕过限制。

除此之外,系统还会监控模型推理过程;一旦发现异常倾向,可能触发减速、暂停,甚至直接终止任务。公开材料也承认这会带来代价,比如正常任务可能因此变慢或被误判中断。
真正的安全,是让模型从一开始就不会驶出边界。
浙大同济校友参与研发:两位研究员的公开履历线索
公开信息尚未给出Astra完整团队名单,但文中提到了至少两位深度参与的华人研究员,并给出了一些可核对的背景线索。
Jiawei Liu:公开材料提到他目前是OpenAI研究员,本科在同济大学计算机专业(2021年毕业)。本科期间参与过高性能人体姿态估计框架HyperPose,并提及成果相关信息(如GitHub关注度等均为文内描述)。随后他前往伊利诺伊大学厄巴纳-香槟分校攻读博士,研究重点逐步转向代码模型与软件可靠性;文中还提到过其研究与工具在机器学习系统中发现过多类严重Bug。
Xiangyu Qi(漆翔宇):公开材料写到他本科毕业于浙江大学计算机科学与技术专业,之后在普林斯顿大学攻读电气与计算机工程博士。研究方向聚焦大模型鲁棒性、越狱攻击与安全对齐,并提及其论文工作(以标题形式在文中出现)。文中还指出他在博士毕业后加入OpenAI,继续参与鲁棒性与网络安全模型相关研究。
如果你关注“能力边界”这类问题,文中也把两位研究员的研究脉络与Astra面临的安全挑战做了对应:能力可以增强,但边界不能变得模糊。

额外爆料与疑问:循环深度(Recurrent Depth)可能影响可监控性
除了OpenAI的技术叙述,文中还提到媒体爆料:Astra可能使用一种名为 “循环深度”(Recurrent Depth) 的技术。公开解释是:传统模型在生成下一个Token前会经过固定数量的网络层;而循环深度让信息在同一组网络层中反复处理,相当于在模型内部让推理“多想几遍”。
材料同时指出,这类技术可能带来能力提升与成本变化,也可能让更多推理发生在模型内部,导致人类更难从输出文本中完整读懂过程。文中引用了一位长期关注AI安全政策的观点:这项技术可能破坏思维链的可监控性。
不过,文中也称媒体信息里提到:OpenAI目前已限制这项技术在Astra中的使用。换句话说,是否会完全放开、对外表现会如何,仍需要后续进一步信息。

最后,文中还提到此前关于发布时间的传闻与后续模型更新背景之间的关联讨论,但这些属于二手信息层面的猜测,不能当作已确认事实。
你更关心哪一部分?是“网络安全关键级”的能力表现,还是OpenAI这套“两道闸门”如何落到实际产品里。你可以在评论区把你的关注点说一下。
本文来源:量子位
点击展开全文



