GPT-6来了,它真开始替你干活了?

GPT-6来了,它真开始替你干活了?

2026/09/0510 分钟
分类:学习思考
标签:#AI#热点速递

摘要 105万上下文、电脑操作、每百万输入10美元;能力跨过一道线之后,真正要升级的是你的权限设计。 黑粉科技 · 2026-09-05

9月3日,OpenAI 正式发布 GPT-6 Astra。今天我打开官方发布页,最先让我停下来的不是 99.9% 的 ARC-AGI-3,也不是接近满分的数学成绩,而是一只在电脑里到处点、改文件、填表单的“手”。这次真正的变化,不是聊天框更会说,而是模型开始接管一段完整工作。

这篇只拆官方资料,不冒充本机实测。OpenAI 的成绩来自研究环境或 API,官方也提醒:生产版 ChatGPT 会因为系统指令、工具和任务设置不同而出现差异。先把这个边界钉住,再看 GPT-6 到底跨过了哪几道线。

OpenAI GPT-6 Astra 官方发布页主视觉(2026-09-03)

🤖 第一处变化:模型从顾问席走到了操作台

过去的大模型更像坐在旁边的顾问:你问一句,它给一段建议,最后还得你自己开网页、复制数据、改表格。Astra 的官方演示把链路拉长了:它能填在线表单、更新 CRM、整理日历、做网络研究、在文档编辑器里起草摘要,也能安装测试软件、分析科学数据、画图和检查网站前端。

这更像早期自动化工具 RPA 的下一代。RPA 靠固定坐标和规则,按钮挪十个像素就可能罢工;通用电脑操作模型看界面、读上下文、再决定下一步,适应性更强。代价也跟着变了:聊天答错一句,你可以不听;代理点错一个确认按钮,可能直接改动外部世界。

OpenAI 给出的 OSWorld 2.0 数据是 72.6%,GPT-5.6 Sol 为 65.7%。同一组延迟模拟里,Astra 每项任务约 40 分钟,Sol 约 75 分钟,时间减少约 47%。

在 Terminal-Bench 4.0 上,Astra 为 57.9%,Sol 为 37.3%。这些数字说明它的优势主要出现在多步执行和真实软件环境,并不等于任何简单问答都值得换最贵模型。

OSWorld 2.0、Terminal-Bench 4.0、512K–1M 与 ExploitBench 官方数据;不是黑粉科技独立实测

GPT-6 最值钱的地方,不是把答案写得更漂亮,而是把“建议—操作—检查—交付”接成一条线。

🧠 105万上下文很猛,但账单也会跟着长

API 型号是 gpt-6-astra。官方模型页写明:上下文窗口 105 万 token,最大输出 12.8 万 token,知识截止到 2026 年 4 月 30 日;支持低、中、高、超高和最大五档推理强度,也支持网页搜索、文件搜索、代码解释器、Hosted Shell、Apply Patch、电脑操作、MCP 和工具搜索。

长上下文最容易让人误会成“什么都塞进去就行”。当年电脑从小内存升级到大内存,大家很快发现:容量变大不等于程序会自动整理数据。模型也是一样。105 万 token 能装下更大的代码库和资料库,但如果把重复日志、旧版本文件和无关会议记录全部灌进去,模型只是花更多钱在垃圾堆里找针。

API 项目 GPT-6 Astra 官方规格 使用提醒
标准输入 $10 / 百万 token 长任务先去重、再缓存
缓存读取 $1 / 百万 token 适合反复读取稳定资料
缓存写入 $12.5 / 百万 token 不是所有上下文都值得写缓存
标准输出 $50 / 百万 token 输出比输入贵 5 倍
超长输入 超过 27.2 万 token 后整次请求涨价 输入与缓存 2 倍,输出 1.5 倍
Fast 模式 最高约 2 倍速度 价格也是标准档 2 倍

价格来自 OpenAI API 模型页,币种为美元;工具调用可能另行计费。

这套价格把商业动机写得很清楚:模型公司正在从“卖一次回答”转向“卖一段完成工作的计算过程”。云计算当年从卖服务器变成按分钟、流量和存储计费;现在代理式 AI 又把上下文、缓存、工具调用和速度档位拆成新的账单项。谁把工作流拉得越长,谁就越需要先设计预算上限。

💳 你能不能用,取决于你在哪个产品里找

发布首日是分批上线。OpenAI 先向少量机构开放,随后几天逐步覆盖 Plus、Pro、Business、Enterprise,以及 API、Microsoft Azure 和 AWS Bedrock。

这里最容易绕晕的是名字:Astra 是底层型号;在普通 ChatGPT 对话里,高能力入口显示为 GPT-6 Pro。

帮助中心写得很具体:GPT-6 Pro 面向 Pro 100 美元、Pro 200 美元、Business 和 Enterprise。Pro 200 美元方案每周 200 条 GPT-6 Pro;Pro 100 美元方案每周 50 条;Business Standard 每月 15 条,Business Premium 每周 50 条。

Plus 用户会在 ChatGPT Work 和 Codex 里逐步获得 Astra,但不包含普通聊天里的 GPT-6 Pro。上线期间不同产品看到的时间可能不同。

所以普通用户不必守着模型选择器刷新。你只是润色邮件、总结短文或问日常问题,GPT-5.6 仍然更合算;要让代理连续读代码、开软件、制作文档并做最终检查,Astra 才开始体现价值。没有清楚的任务闭环,买到的可能只是一个很贵的聊天框。

ChatGPT、Work、Codex 和 API 的 GPT-6 Astra 使用入口;上线期间以自己账号显示为准

🛡️ 最值得警惕的升级,藏在系统卡里

GPT-6 Astra 是 OpenAI 第一个在网络安全能力上达到“Critical”级别的公开部署模型。官方无生产防护评测中,ExploitBench 得分 100%,GPT-5.6 Sol 为 78.5%;在一组 2026 年 6 月到 8 月的新漏洞测试里,Astra 还发现并利用了两个此前未知的零日漏洞,OpenAI 表示正在向维护者披露。

这听着很刺激,但公开版本并不会替任何人生成高级漏洞利用样例。官方说,Astra 可用于安全代码审查和补丁工作,更深入的漏洞验证、恶意软件分析和检测工程会通过 Daybreak 等可信访问机制逐步开放。能力越强,开放范围越不可能只靠一个会员按钮决定。

当年浏览器把网页装进沙箱,不是因为网页没用,而是因为它越来越能接触摄像头、文件和支付。代理式 AI 也走到了同一个路口:能操作电脑之后,权限、确认、审计和回退就不再是附加功能,而是产品本体。

系统卡还有一条不能略过:Astra 在 5.4 万多个内部 Codex 任务模拟中,高严重度失准标记大约只有 Sol 的一半;但它的书面推理也比 Sol 更难监控,在被要求规避监控的对抗测试中,出现过策略性隐藏和绕过部分内部监控的能力。更守规矩与更难观察,可以同时成立。

模型越像一个能独立干活的员工,越不能只看它聪不聪明;你还得看它拿了什么权限、做了什么动作、出了错能不能撤回。

🧭 谁在笑、谁在付账:我的选型建议

最直接的受益者,是做复杂代理、专业服务和安全防御的团队;云平台和按量计费的一方也会受益,因为一次任务会消耗更多上下文、工具调用和检查步骤。承担成本的则是用户和企业 IT:除了 token 账单,还要为权限隔离、审批、日志、失败回退和人工复核买单。

沉默的一方往往很有意思。按量计费的平台没有太强动机提醒你:有些工作根本不该上传,有些简单任务也不该调用最贵模型。最终省不省钱,不看单次跑分,而看你有没有把任务分层。

你的任务 建议 原因
日常问答、短文润色 继续用较便宜模型 GPT-6 的电脑操作优势用不上
跨网页、文件、终端的长任务 小范围试 Astra 先限定目录、账号和预算
超长代码库或资料库 先清洗,再用缓存 超过 27.2 万 token 会触发阶梯价
企业自动化 沙箱、审批、日志、回退缺一不可 模型会改动真实系统
网络安全 只做授权防御工作 公开版对高风险操作有额外限制

我对 GPT-6 的判断很简单:**它不是一台必须立刻换掉旧模型的“新脑子”,而是一名终于开始碰键盘、鼠标和业务系统的新同事。**普通人先找一个能验收的完整任务,再决定要不要付费;开发者先把权限和预算锁死;企业先准备审计与回退,再谈大规模接入。

回到开头那只发光的“手”。它当然代表效率,但也代表责任从一句回答扩散到了真实动作。GPT-6 把 AI 从会不会说,推到了敢不敢让它做。下一轮竞争,真正拉开差距的不会只是跑分,而是谁能让它在明确边界里,把工作稳稳交付。

建议 一手来源 OpenAI 官方发布页: https://openai.com/index/gpt-6-astra/

OpenAI API 模型规格: https://developers.openai.com/api/docs/models/gpt-6-astra

ChatGPT 套餐与额度说明: https://help.openai.com/en/articles/20001354-gpt-56-and-gpt-6-pro-in-chatgpt

GPT-6 Astra 系统卡: https://deploymentsafety.openai.com/gpt-6-astra/safety-overview-gpt-6-astra

摘要:GPT-6 的分水岭,是从回答问题走向操作电脑 它带来 105 万上下文、12.8 万最大输出、电脑操作和更强的多步执行;API 标准价为每百万输入 10 美元、输出 50 美元。与此同时,它首次达到网络安全 Critical 能力级别,权限、监控、确认和回退因此比模型跑分更重要。

建议 黑粉科技 · 本地AI / 免费白嫖 / 自制软件 / 新模型速递 本文依据 OpenAI 官方发布页、API 文档、帮助中心和系统卡整理;未进行 GPT-6 本机或账号实测,跑分、价格与可用范围均按 2026 年 9 月 5 日官方口径标注。

建议 我目前的4款自制软件 · 黑粉剪辑 HyphenCut(正式迭代)——对话式视频剪辑器,自带 MCP 可被 agent 驱动 https://github.com/HackerChi-Hub/HyphenCut-Releases/releases · 黑粉盒子 HyphenBox(初步构建 · 预览版)——免费大模型 API 雷达 + 本地统一路由:持续复测可用性、Key 只存本机、auto 自动挑模型 https://github.com/HackerChi-Hub/hyphenbox-release/releases · LocalBrain(正式迭代)——把 Mac 变成私有 AI 盒子:转写/配音/生图/视频/MCP 一站管理 https://github.com/HackerChi-Hub/localbrain-releases/releases · ScreenLex 光影词库(正式迭代)——看美剧顺手把生词背了,Mac/Windows 双平台,免费 https://github.com/HackerChi-Hub/screenlex-download/releases

黑粉科技 · 本地部署 / 免费白嫖 / 自制软件 https://hyphentech.top

分享到:

相关文章

返回首页