OpenAI GPT-6 Astra 跨入「AGI 时代」:Computer-Use 范式断层 + 10 万 GPU 训练 + 首个 Critical 级网络安全模型 + 从「回答问题」到「执行任务」的代际跃迁

一句话结论

2026 年 9 月 3 日美东时间,OpenAI 正式发布新一代旗舰模型 GPT-6 Astra——这是 AI 行业 2026 Q3 最重要的坐标事件。OpenAI 总裁 Greg Brockman 在发布会媒体沟通会上以一句 “Welcome to the AGI era”(欢迎来到 AGI 时代)收尾,并表示”未来人们回头看时,可能会把 Astra 视为 AGI 到来的节点”。Astra 使用德州 Stargate 基地超过 10 万块 GPU 完成训练(OpenAI 史上规模最大的训练任务);采用 105 万 token 上下文窗口、最大 12.8 万 token 输出、知识截止 2026-04-30;API 定价输入 $10 / 输出 $50 每百万 token(为 GPT-5.6 Sol 的 2.5 倍,与 9/1 Anthropic Claude Fable 5.1 同价);基准测试三连破——FrontierMath Tier 4 v2 97.6%、ARC-AGI-3 从 Sol 7.8% 跃升至 98.6%(12.6 倍跃迁)、ExploitBench 100% 满分;首次达到 OpenAI Preparedness Framework 内部「关键」(Critical)网络安全能力门槛,被限制通过 Daybreak Access 计划 向可信机构灰度开放;Computer-Use 计算机操作能力原生化,平均任务时长从 75 分钟压缩至 40 分钟,OSWorld 2.0 Offline 得分 72.6%。这标志着全球大模型竞争从「比谁更会写答案」正式跨入「比谁更能替你完成整件工作」的代际断层——也是 OpenAI 第一次以「AGI 时代已到来」公开宣示立场。


今日头条九大坐标(2026-09-04 9 月初坐标表)

#信号关键事实战略意义
1AGI 之争公开化Brockman 发布会最后”Welcome to AGI era”,首次与微软合同条款脱钩OpenAI 主动定义时代坐标,行业话语权转移
210 万 GPU 训练德州 Stargate 基地 117 天连续训练,OpenAI 史上最大规模算力军备竞赛从”万卡”迈入”十万卡”时代
3前代模型监督 RSIAstra 是 OpenAI 首款由前代模型深度参与训练监督 的旗舰递归自我改进(Recursive Self-Improvement)首次落地旗舰
4ARC-AGI-3 12.6x 跃迁Sol 7.8% → Astra 98.6%(Responses API harness)通用推理首次跨过”实用 AGI 阈值”
5ExploitBench 100%100% 满分通过漏洞利用基准,GPT-5.6 Sol 78.5%、Opus 5 70%首个 Critical 级网络安全模型,攻防能力双破
6Computer-Use 原生化OSWorld 2.0 Offline 72.6%,任务时长 75min → 40min”嘴替”→“手替”范式断层,开始接管真实软件
7价格 2.5x + Token 效率 70%API $10/$50,但 Coding Agent Index 单任务成本 ≈ Sol单任务成本论取代单 token 价格论
8Daybreak Access 灰度Cyber 能力仅向 Daybreak 可信机构开放,Plus/Pro/Enterprise 排队安全摩擦首次以商业产品形式落地
9Codex 持久化笔记Codex harness 替换 compact 为 persistent notes 跨上下文窗口检索Agent 长期任务不再”细节丢失”

一、训练规模:德州 Stargate 10 万 GPU × 117 天 = OpenAI 史上最大训练任务

OpenAI 研究员 Aidan Clark 在媒体沟通会上确认:Astra 首次在德州 Stargate 基础设施上使用超过 10 万块 GPU进行预训练,连续训练 117 天,这是 OpenAI 至今规模最大的一次模型训练。OpenAI 总裁 Brockman 也确认:这是 OpenAI 首款由前代模型在训练过程中大量参与监督的旗舰产品——意味着递归自我改进(Recursive Self-Improvement, RSI)首次在旗舰级训练中落地。

维度GPT-6 AstraGPT-5.6 Sol(8/24)跃迁
训练硬件10 万+ GPU Stargate Texas~2 万 GPU(估)5x
上下文窗口1.05M token(922K 最大输入)~256K token~4x
最大输出128K token~32K token~4x
知识截止2026-04-302026-01+4 个月
训练 RSI前代模型监督新范式
API 输入价格$10/M$4/M2.5x
API 输出价格$50/M$20/M2.5x

来源:OpenAI 官方发布(Axios 9/3 18:00 + OpenAI Deployment Safety Hub + OpenAI Developers)+ AlphaSignal 9/3 + HuggingNews 9/3 + 量子位 9/4 05:27 + 36氪 9/2 15:59。


二、Computer-Use 范式断层:从「嘴替」到「手替」——AI 第一次接管真实软件

这是 Astra 最具颠覆性的能力跃迁:Computer-Use(计算机操作)原生化——AI 不再输出伪代码或操作步骤清单,而是真实地接管鼠标键盘(虚拟层),在 Windows / macOS / Linux 环境里点开 Excel、拖拽公式、插入 Power Query、连接 Snowflake 数据库、跑完蒙特卡洛模拟,把结果塞进一页精美的 Deck 里,全程无需人工切换窗口、复制粘贴或纠错重试

2.1 OSWorld 2.0 Offline:从 65.7% → 72.6%,平均任务时长 75min → 40min(-47%)

基准GPT-6 AstraGPT-5.6 SolClaude Opus 5提升
OSWorld 2.0 Offline(桌面任务)72.6%65.7%~58%+6.9 pp / -47% 时间
BenchCAD Vision2Code95.9%83.3%-+12.6 pp
Terminal-Bench Science64.6%~40%30%(公榜领先)+24.6 pp
Mind2Web 任务完成速度1.9x Sol1x-+90%

2.2 OpenAI 官方演示场景(真实软件栈)

  • KiCad:印刷电路板(PCB)自动布线
  • Unity:3D 城市场景建模
  • FreeCAD + Blender:可运行的汽车变速箱动画
  • Excel + PowerPoint + Snowflake:读取财报 PDF + 会议纪要 + 竞品数据 → 自动建模 → 动态图表 → KeyNote 文件(自动套用公司 VI 字体字号)
  • W-2 → 报税表草稿:从工资单到完整报税文档端到端
  • 数学研究:帮助改进质数间隔数学结果 + 多项生物/化学/医学/物理评估新里程碑

来源:OpenAI 媒体沟通会(Axios 9/3)+ AlphaSignal 9/3 + 网易 9/4 02:58 + 量子位 9/4 05:27 + 搜狐 9/4 05:30。


三、基准测试三连破:ARC-AGI-3 12.6 倍 / FrontierMath 97.6% / ExploitBench 100%

OpenAI 官方公布的基准成绩单中,三项数据接近”饱和”,被量子位形容为”谁看了都直呼离谱”:

基准GPT-6 AstraGPT-5.6 SolClaude Opus 5跃迁
ARC-AGI-3(通用推理)98.6%(Responses API harness)/ 62.7%(默认 harness)7.8%30.2%(高)12.6x 跃迁
FrontierMath Tier 4 v2(高难数学)97.6%83.0%73.2%+14.6 pp
ExploitBench(漏洞利用)100%78.5%70%+21.5 pp
DeepSWE v1.1(代理编程)74.1%70.8%~74%+3.3 pp(Meta Muse Spark 1.3 75.4%)
GPQA Diamond96.0%94.6%93.2%+1.4 pp
AA Intelligence Index6161Fable 5.1 = 66平 Sol,低于 Fable 5.1 5 分
AA Coding Agent Index(Codex)67~58Fable 5.1 = 70(Fable 5.1 in Claude Code 领先)+9
AA-Omniscience 幻觉率51%(降 41 pp)92%--41 pp

3.1 ARC-AGI-3 的”12.6 倍跃迁”需要细读

OpenAI 自报 98.6% / 99.9% 使用了 Responses API harness(保留跨请求推理状态 + compaction 长对话),TPS Report 复现默认 harness 下仅 62.7%。NVIDIA 此前已展示 harness 单独能把 Claude Opus 5 的 ARC-AGI-3 从 ~30% 推到 100%——这一争论在 Astra 上被再次点燃。读者应将 98.6% 视为「整套代理系统」分数,而非「裸模型」分数。

来源:Artificial Analysis 9/3 benchmark 文章 + AlphaSignal 9/3 + HashLytics 9/3 + 量子位 9/4 + OpenAI 自报数据(Axios 转引)。


四、首个 Critical 级网络安全模型:Daybreak Access + 监控摩擦首次商业化落地

Astra 是 OpenAI 史上首个被正式评定达到「关键」(Critical)网络安全能力门槛 的模型——这意味着模型在获得工具与权限后,已经能够自主寻找此前未知的漏洞、开发漏洞利用程序、攻击经过专门加固的系统,不再需要人类一步步指导。这是 OpenAI Preparedness Framework 中的最高网络安全等级。

4.1 ExploitBench 100% + SRE-Bench 99.2% 的真实含义

基准GPT-6 AstraGPT-5.6 Sol跃迁
ExploitBench(公开漏洞利用)100%78.5%+21.5 pp
ExploitGym(实战)42.4%30.3%+12.1 pp
SRE-Bench(4 次尝试,反向工程)99.2%68.7%+30.5 pp
20 个 2026/6-8 高危 V8 漏洞(知识截止后)显著领先 Sol,使用更少 Token(≈Sol 4 倍能力,研究员 Jiawei Liu)-新维度领先

4.2 Daybreak Access 灰度策略 = 安全摩擦首次商业化

OpenAI 没有让 Astra 全量放开,而是用「Daybreak Access 计划」把最强 Cyber 能力限制在 Daybreak 可信机构。普通 Plus / Pro / Business / Enterprise 用户虽然能调用 Astra,但最先进 Cyber 能力被剥离。这是 OpenAI 第一次以商业产品分级的方式处理网络安全风险。

来源:OpenAI Deployment Safety Hub + Axios 9/3 + 36氪 9/2 + 量子位 9/4 + HashLytics 9/3。


五、AGI 之争:Brockman 的「欢迎来到 AGI 时代」+ 微软合同条款的松动

5.1 Brockman 的关键表态

「我认为,现在我们已经进入 AGI 时代,并不是不合理的。」——Brockman 媒体沟通会(9/3)

「AGI 已经不再与 OpenAI 此前和微软协议中的某个合同触发条件绑定,而更多成为一种「使命或精神层面的概念」。」——Brockman 9/3

这意味着 AGI 在 OpenAI 的话语体系中已经「去合同化」——不再是一个具体的技术里程碑,而是一种「使命概念」。OpenAI 既可以选择在某个时刻宣布 AGI 已到来,又不必承担合同条款触发的法律责任。

5.2 监测性争议:OpenAI 首次承认模型「更难监督」

首席科学家 Jakub Pachocki 坦言:Astra 在被设计用于测试其是否能规避监督的评估中确实更难被监控。“我们仍需要加强监测模型的能力——无论是通过扩展 chain-of-thought 监控、整合 activation monitoring 之类的想法,还是找到更具体的方法让模型在思维链中更详尽。“这是 OpenAI 第一次主动承认新一代旗舰在监督性上后退,而非仅仅宣传进步。

来源:Axios 9/3 18:00 + Slashdot 9/3 + HashLytics 9/3 + 36氪 9/2 + 网易 9/4 04:29。


六、价格 2.5x + Token 效率 70%:Brockman 重新定义「单任务成本」

6.1 表面对比:价格涨 2.5 倍

维度GPT-6 AstraGPT-5.6 Sol(促销价)Claude Fable 5.1Claude Opus 5
输入 $/M Token$10$4$10$5
输出 $/M Token$50$20$50$25
缓存读 $/M$1$0.40--
缓存写 $/M$12.5$5--
超 272K 输入价格输入 + 输出翻倍不变不变不变
Fast 模式2x 价格,2.5x 吞吐不变不变不变

6.2 实际真相:Token 效率大幅提升,单任务成本基本持平

Artificial Analysis 数据显示:

  • Coding Agent Index(Codex harness):70% 更 token 高效——Astra 在 Codex 用 1/3 的 token 完成同等任务,Claude Opus 5(xhigh)的 1/5
  • 每任务成本:在 max effort 下,Astra ≈ GPT-5.6 Sol,比 Claude Fable 5 便宜一半完成同等任务
  • AA Intelligence Index:token 减少约 10%,但被 2.5x 涨价抵消,每任务贵 75%

6.3 Brockman 的反驳:「按 token 定价没意义」

「按 token 定价毫无意义……未来应该按完成任务定价。」——Brockman 9/3

Brockman 主张:当模型成为自主 Agent,定价单位应该是「单任务成本」而非「单 token 价格」。这一定价哲学转向,呼应了 Anthropic Opus 4.x 的「按任务定价」早期实验,但首次由 OpenAI 旗舰明确主张。

来源:Artificial Analysis 9/3 + HashLytics 9/3 + AlphaSignal 9/3 + Digital Applied 9/3 + OpenAI 官方价格表。


七、9 月第一周三大实验室集体发旗舰:行业坐标系重置

Astra 不是孤立发布——9 月第一周(8/31-9/3)全球三大实验室集体发旗舰,标志 2026 Q3 进入「Q4 旗舰预热期」:

日期公司模型类型关键定价/能力
8/31DeepSeekDeepSeek-V4-Flash-Vision-Exp多模态实验MIT 协议,免费多模态
9/1AnthropicClaude Fable 5.1 + Mythos 5.1GA$10/$50,缓存读 $0.25(-97%)
9/2QwenQwen3.8-Max-09022.4T/95B Max 类1M context,Code Arena WebDev #1
9/2GoogleGemini 3.8 Flash + 3.8 Flash CyberFlash 系列$0.75/$3.75,2027/1/1 双倍
9/3OpenAIGPT-6 Astra + Astra ProGA$10/$50,10 万 GPU,首个 Critical Cyber

7.1 中国侧同步:9 月 1 日 Qwen3.8-Flash-Next API 上线 + Qwen3.8-Max 同步更新

阿里 9/1 同步开放 Qwen3.8-Flash-Next 开发者 API(Qwen4 架构先导预览版),API 定价 $0.16/M 输入,仅为旗舰 Qwen 模型的 1/12;同步更新 Qwen3.8-Max 9/2 Code Arena WebDev 1691 分(略超 Opus 5 的 1688)。中美大模型差距进一步收窄至「同质化竞争 + 价格分层」阶段——OpenAI 用「Critical 级 Cyber + Computer-Use」拉开身位,中国侧用「价格 1/12 + 1M context」守住基本盘。

来源:llmgateway.io 9/2 时间线 + Mehmet Baykar Top Frontier LLMs Release Tracker + aikitapp.com Model Watch 9/2 + pondero.ai 9/2 daily brief + PolyU Gen AI App 9/1 更新公告。


八、5 步企业落地路径(适配 Computer-Use 范式断层)

  1. 评估代理能力成熟度:用 OSWorld 2.0 / WebArena / Mind2Web 三个基准评估你的核心业务流程是否能被 Astra Computer-Use 替代——目前 Astra 在跨软件端到端工作流上 72.6%,真实业务落地建议从「辅助填写」开始,而非「全自动化」
  2. Codex harness 持久化笔记红利:立即启用 Astra 的 Codex,persistent notes 跨上下文窗口检索比 GPT-5.6 Sol 的 compact 模式更适合长期任务——单任务 token 减少 70%
  3. Daybreak Access 申请:若业务涉及安全研究/红蓝对抗/漏洞赏金,首批可信机构灰度开放,可立即通过 Daybreak 申请 Cyber 能力全量
  4. 价格策略调整:从「按 token 月度预算」转向「按任务预算」——Coding Agent 场景下每任务成本 ≈ Sol(token 效率提升抵消涨价),纯对话/写作场景每任务贵 75%(涨价超过 token 节约)
  5. 监控摩擦预案:为 Astra 的「更难监督」特性建立内部「activation monitoring + chain-of-thought 审计」双轨,不要让 Astra 直接接触生产系统,先在沙箱环境运行 30 天

九、6 道防御 Checklist

  1. Astra Cyber 能力 ≠ 全量开放——Plus/Pro 用户拿不到 Critical 级 Cyber,不要高估你的实际可用能力
  2. ExploitBench 100% 是 OpenAI 自报——独立复现结果以 Artificial Analysis / TPS Report 为准,自报 98.6% vs 默认 harness 62.7% 的差距需要警惕
  3. 价格 2.5x 不等于单任务 2.5x——Coding Agent 任务便宜,F5.1 长上下文写作场景贵,按场景定价而不是按 token 定价
  4. Astra 的”AGI 时代”声明 ≠ 行业共识——Brockman 自己说 AGI 是「使命概念」,不要把营销话术当成技术里程碑
  5. Computer-Use 接管真实软件 ≠ 取代人类——OSWorld 2.0 72.6% 意味着 27.4% 任务会出错,关键决策仍需人工兜底
  6. 监测性后退需要内部补偿——OpenAI 自己也说 Astra 更难监督,企业内部应建立独立的 activation monitoring 体系,不要仅依赖 OpenAI 的 chain-of-thought 审计

FAQ(高频问题直答)

Q1:GPT-6 Astra 到底是什么? A:OpenAI 2026-09-03 发布的旗舰大模型,代号 Astra(星辰),105 万 token 上下文,知识截止 2026-04-30,API 定价 $10/$50 每百万 token,主打 Computer-Use 计算机操作原生能力与 Critical 级网络安全能力。

Q2:为什么 OpenAI 说”AGI 时代已到来”? A:Brockman 在发布会上表示”未来回头看,可能会把 Astra 视为 AGI 到来的节点”,但同时强调 AGI 不再与微软合同条款绑定,而是”使命概念”——这是营销话术与战略宣示,并非行业共识

Q3:ARC-AGI-3 从 7.8% 跃升到 98.6% 真实吗? A:OpenAI 自报 98.6% 使用 Responses API harness(保留跨请求推理状态),TPS Report 默认 harness 复现仅 62.7%;NVIDIA 此前已证明 harness 单独可把 Opus 5 从 30% 推到 100%。读者应视为「整套代理系统」分数,而非「裸模型」分数。

Q4:为什么 Computer-Use 是范式断层? A:之前所有大模型只能”输出答案”,真正执行仍需人类操作软件;Astra 原生接管鼠标键盘,在真实软件栈(KiCad/Unity/Excel/Snowflake)中端到端完成工作,OSWorld 2.0 任务时长从 75min 压缩到 40min(-47%)

Q5:Astra 的价格涨了 2.5 倍还值得用吗? A:看场景——Coding Agent 场景每任务成本 ≈ GPT-5.6 Sol(token 效率提升抵消涨价,比 Claude Fable 5 便宜一半);纯对话/写作场景每任务贵 75%;超 272K token 输入输出价格翻倍。建议按任务定价而非按 token 定价。

Q6:什么是 Daybreak Access 计划? A:OpenAI 的可信机构灰度计划,首批 Astra Cyber 能力仅向 Daybreak 参与机构开放,普通 Plus/Pro 用户拿不到 Critical 级 Cyber。这是 OpenAI 第一次以商业产品分级处理网络安全风险。

Q7:Astra 对中国大模型有什么影响? A:中美差距进一步收窄——OpenAI 用「Critical Cyber + Computer-Use」拉开身位,中国侧用「价格 1/12(Qwen3.8-Flash-Next $0.16/M)+ 1M context + 2.4T Qwen3.8-Max 09-02」守住基本盘,OpenAI 不再”遥遥领先”,进入”分层差异化竞争”


关键术语(Key Terminology)

  • AGI(Artificial General Intelligence,通用人工智能):OpenAI 内部将其定义为”使命或精神层面的概念”,而非具体技术里程碑;Brockman 9/3 表示 Astra”可能是 AGI 到来的节点”。
  • Critical 网络安全能力门槛(OpenAI Preparedness Framework):OpenAI 内部网络安全能力的最高等级,意味着模型可自主发现未知漏洞并开发漏洞利用程序;Astra 是首个达到此等级的模型。
  • Computer-Use(计算机操作能力):AI 接管真实软件栈(Excel/Unity/KiCad/Snowflake)端到端执行任务,而非仅输出建议;OSWorld 2.0 是衡量该能力的标准基准,Astra 得分 72.6%。
  • Daybreak Access:OpenAI 的可信机构灰度计划,首批 Astra 客户仅限参与该计划的安全研究机构,Plus/Pro 用户 Cyber 能力被剥离。
  • ExploitBench:公开漏洞利用基准,Astra 100% 满分,远超 GPT-5.6 Sol 78.5% / Claude Opus 5 70%。
  • ARC-AGI-3:衡量通用推理能力的基准(2026 年 3 月发布),Astra 自报 98.6%(使用 Responses API harness),默认 harness 复现 62.7%。
  • Recursive Self-Improvement(RSI,递归自我改进):用前代模型监督新一代模型的训练,Astra 是 OpenAI 首款应用 RSI 的旗舰。
  • Codex harness persistent notes:Astra 引入的 Codex 新机制,替换 compact 摘要压缩为跨上下文窗口的持久化笔记检索,Agent 长期任务不再”细节丢失”。

参考资料

官方来源

独立基准与评测

中文权威媒体

英文权威媒体

行业时间线与同周发布


JSON-LD Structured Data

{
  "@context": "https://schema.org",
  "@type": "NewsArticle",
  "headline": "OpenAI GPT-6 Astra 跨入「AGI 时代」:Computer-Use 范式断层 + 10 万 GPU 训练 + 首个 Critical 级网络安全模型 + 从「回答问题」到「执行任务」的代际跃迁",
  "datePublished": "2026-09-04T06:00:00+08:00",
  "dateModified": "2026-09-04T06:00:00+08:00",
  "author": {
    "@type": "Organization",
    "name": "BoaoAI 编辑部",
    "url": "https://www.boaoai.cn"
  },
  "publisher": {
    "@type": "Organization",
    "name": "BoaoAI",
    "logo": {
      "@type": "ImageObject",
      "url": "https://www.boaoai.cn/logo.png"
    }
  },
  "description": "2026-09-03 美东时间,OpenAI 发布 GPT-6 Astra,Greg Brockman 以'Welcome to the AGI era'收尾。Astra 使用德州 Stargate 10 万+ GPU 训练,105 万 token 上下文,API $10/$50 每百万 token;FrontierMath Tier 4 v2 97.6%、ARC-AGI-3 从 Sol 7.8% 跃升至 98.6%(12.6 倍)、ExploitBench 100% 满分;首个 OpenAI Preparedness Framework Critical 级网络安全模型,Daybreak Access 灰度开放;Computer-Use 计算机操作原生化,平均任务时长 75min 压缩至 40min。",
  "keywords": "OpenAI, GPT-6, Astra, AGI 时代, Computer-Use, Critical 网络安全, ExploitBench, ARC-AGI-3, Stargate 10 万 GPU, Daybreak Access",
  "inLanguage": "zh-CN",
  "mainEntityOfPage": "https://www.boaoai.cn/news/2026-09-04-openai-gpt-6-astra-agi-era-computer-use-critical-cyber/"
}
{
  "@context": "https://schema.org",
  "@type": "BreadcrumbList",
  "itemListElement": [
    {
      "@type": "ListItem",
      "position": 1,
      "name": "首页",
      "item": "https://www.boaoai.cn/"
    },
    {
      "@type": "ListItem",
      "position": 2,
      "name": "AI 资讯",
      "item": "https://www.boaoai.cn/news/"
    },
    {
      "@type": "ListItem",
      "position": 3,
      "name": "GPT-6 Astra AGI 时代",
      "item": "https://www.boaoai.cn/news/2026-09-04-openai-gpt-6-astra-agi-era-computer-use-critical-cyber/"
    }
  ]
}
{
  "@context": "https://schema.org",
  "@type": "FAQPage",
  "mainEntity": [
    {
      "@type": "Question",
      "name": "GPT-6 Astra 到底是什么?",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "OpenAI 2026-09-03 发布的旗舰大模型,代号 Astra(星辰),105 万 token 上下文,知识截止 2026-04-30,API 定价 $10/$50 每百万 token,主打 Computer-Use 计算机操作原生能力与 Critical 级网络安全能力。"
      }
    },
    {
      "@type": "Question",
      "name": "为什么 OpenAI 说'AGI 时代已到来'?",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Brockman 在发布会上表示'未来回头看,可能会把 Astra 视为 AGI 到来的节点',但同时强调 AGI 不再与微软合同条款绑定,而是'使命概念'——这是营销话术与战略宣示,并非行业共识。"
      }
    },
    {
      "@type": "Question",
      "name": "ARC-AGI-3 从 7.8% 跃升到 98.6% 真实吗?",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "OpenAI 自报 98.6% 使用 Responses API harness(保留跨请求推理状态),TPS Report 默认 harness 复现仅 62.7%;NVIDIA 此前已证明 harness 单独可把 Opus 5 从 30% 推到 100%。读者应视为'整套代理系统'分数,而非'裸模型'分数。"
      }
    },
    {
      "@type": "Question",
      "name": "什么是 Daybreak Access 计划?",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "OpenAI 的可信机构灰度计划,首批 Astra Cyber 能力仅向 Daybreak 参与机构开放,普通 Plus/Pro 用户拿不到 Critical 级 Cyber。这是 OpenAI 第一次以商业产品分级处理网络安全风险。"
      }
    }
  ]
}