![图片[1]-OpenAI GPT-6 Astra正式发布:欢迎来到AGI时代!ARC-AGI-3冲到99.9%,从操作电脑到3D建模,AI开始真正“替你干活”?](https://www.mohe-sc.com/wp-content/uploads/2026/09/OpenAI-GPT-6-Astra正式发布:欢迎来到AGI时代!ARC-AGI-3冲到99.9,从操作电脑到3D建模,AI开始真正替你干活?.jpg)
OpenAI这次是真的把AI Agent往前推了一大步。GPT-6 Astra正式发布后,最吸引眼球的已经不只是“模型更聪明”,而是它开始更加像一个能够直接坐在电脑前替你工作的AI。OpenAI将其定位为目前能力最强的模型之一,重点强化了电脑操作、浏览器使用、软件工程、科学研究、网络安全以及专业工作流,并支持最高105万Token上下文和12.8万Token最大输出。
更夸张的是,GPT-6 Astra在ARC-AGI-3上拿到了99.9%的成绩,同时在FrontierMath Tier 4达到98%,ExploitBench达到100%。但真正值得普通用户关注的并不是几个榜单数字,而是它正在改变AI的使用方式:过去我们让AI“告诉我怎么做”,现在则可以让它直接打开软件、操作电脑、编写代码、测试程序、处理文件,并把一个复杂任务一路做下去。
GPT-6 Astra 到底是什么?
GPT-6 Astra并不是简单意义上的GPT-5.6升级版,而是OpenAI针对端到端复杂任务打造的新一代旗舰模型。官方API文档显示,GPT-6 Astra的模型ID为gpt-6-astra,支持low、medium、high、xhigh和max多个推理强度档位,可以根据任务难度调整推理投入。
它最大的变化在于,模型能力不再局限于生成文字。通过Responses API,它可以调用网页搜索、文件搜索、代码解释器、Hosted Shell、Computer Use、图像生成以及MCP等工具。这意味着开发者可以把GPT-6 Astra放进一个完整的Agent工作流中,让模型自己完成从理解需求到执行任务再到验证结果的整个过程。
第一大升级:AI终于开始真正“操作电脑”
过去的AI Agent经常需要开发者给它准备专门的API,例如想让AI操作CRM,需要先开发CRM API;想让AI修改数据库,需要写数据库工具;想让AI操作某款软件,还得专门开发插件。
GPT-6 Astra走的是另外一条路线:让AI直接理解电脑界面并进行操作。
这也是它最值得关注的能力之一。OpenAI公布的测试数据显示,GPT-6 Astra在OSWorld 2.0、ScreenSpot-Pro以及Agents’ Last Exam等电脑操作相关测试中都取得了非常高的成绩,其中OSWorld 2.0达到72.6%,ScreenSpot-Pro达到92.7%,简单理解,以后你不一定需要告诉AI“点击哪个按钮、输入什么命令”,而可以直接告诉它:
“打开这个软件,把这批文件整理好,然后导出结果。”
AI自己理解界面、寻找按钮、执行操作并继续下一步,这才是真正意义上的Computer Use。
第二大升级:从“写代码”变成“完成软件项目”
如果你只是让GPT-6 Astra写一个几十行Python脚本,其实有点大材小用,它真正适合的是复杂的软件工程。
例如一个大型项目包含前端、后端、数据库、API、测试以及大量依赖文件。过去开发者需要不断把代码复制给AI,让模型分析以后再手动修改。
GPT-6 Astra则可以直接参与整个开发流程:理解项目 → 分析代码 → 修改文件 → 执行代码 → 浏览器测试 → 发现Bug → 修复 → 再测试。OpenAI将GPT-6 Astra称为目前最强的软件工程模型,并强调它在Agentic Coding场景下可以承担更加复杂的多步骤开发任务。
这意味着AI编程正在从:
“帮我写代码”
逐渐变成:
“帮我把这个功能做出来。”
两者其实是完全不同的概念。
第三大升级:1M上下文开始真正有用了
GPT-6 Astra提供约105万Token上下文窗口,最大输出达到128K Token,超长上下文真正有价值的地方,不是让用户一次性聊天几百页,而是让AI能够处理更加庞大的真实工作资料,例如:
整个代码仓库 + 项目文档 + API文档 + 测试结果 + 错误日志
可以放进同一个任务环境,对于企业用户来说,还可以处理:
合同 + Excel + PDF + 邮件 + 数据报告 + 内部文档
然后让AI直接完成分析,因此,1M上下文更应该理解成一种复杂任务工作空间,而不是单纯的“聊天记忆更长”。
第四大升级:AI开始进入专业软件
这可能是GPT-6 Astra最容易被低估的能力,OpenAI公布的BenchCAD测试中,GPT-6 Astra可以根据多视角渲染结果,通过生成CAD代码重建3D对象,达到95.9%的几何重叠得分,高于GPT-5.6 Sol的83.3%。官方还给出了大约2分54秒的演示任务耗时,这意味着未来AI不一定只是告诉你:
“这个3D模型应该怎么做。”
而是可以进一步:
打开3D软件 → 分析参考图 → 创建模型 → 修改参数 → 检查结果。
对于3D建模、建筑设计、工业设计以及工程软件来说,这种能力的意义非常大。
这也是为什么现在AI竞争越来越不像传统的“聊天机器人大战”,真正的竞争开始变成:谁能够直接进入用户的软件和工作流程。
第五大升级:AI Agent开始拥有“完整工作闭环”
如果把GPT-6 Astra的能力拆开来看,它最重要的并不是某一个单项能力,而是这些能力终于可以组合起来,一个完整Agent可能执行这样的流程:
理解需求 → 搜索资料 → 读取文件 → 分析数据 → 操作电脑 → 编写代码 → 运行测试 → 发现问题 → 修改 → 再次验证 → 输出最终文件。
过去每一步可能都需要人类介入,现在越来越多步骤可以交给AI自动完成,OpenAI在专业工作测试中也展示了类似能力,包括文档、演示文稿、表格和数据分析等任务。GPT-6 Astra强调的不只是生成内容,而是根据模板和工作环境直接产生更加接近最终交付状态的成果。
GPT-6 Astra与普通聊天AI最大的区别
如果一定要用一句话概括:
普通AI更像一个“顾问”,GPT-6 Astra正在变成一个“执行者”。
以前你可能问:
“如何制作一个网站?”
AI回答步骤,现在你可以进一步要求:
“帮我把这个网站做出来。”
AI需要自己分析需求、编写代码、运行环境、检查页面,再不断修复问题,这就是Agentic AI真正有价值的地方。
GPT-6 Astra并不是“什么都能自动做”
即使模型具备更强的推理、Computer Use以及复杂任务执行能力,真正进入实际应用之后,安全、权限和监控依然是无法绕开的关键问题。尤其当AI开始从“给出答案”进一步发展到“直接操作电脑和软件”,模型能够执行的动作越多,企业需要承担的安全责任也就越高。
从目前官方披露的信息来看,GPT-6 Astra已经被定义为达到Preparedness Framework中Critical级网络安全能力阈值的模型,因此这次发布同样非常强调安全机制,包括模型隔离、检查点加密、全轨迹监控以及部署前安全评估等措施。对于企业来说,这意味着部署GPT-6 Astra并不是简单地接入API,而是需要同时建立完善的权限管理和操作审计机制。
尤其是Computer Use能力出现之后,问题也正在发生变化。过去企业更关心的是“AI能不能把事情做好”,而未来可能更加关注**“AI到底应该被允许做什么”**。当AI能够操作浏览器、软件甚至执行复杂工作流时,权限边界、人工确认、操作记录和异常监控都会成为AI Agent真正走向商业化必须解决的问题。
GPT-6 Astra适合哪些人?
如果只是聊天、写文章、总结资料,并不一定需要直接使用GPT-6 Astra,它真正适合的是需要让AI承担复杂任务的人。
API价格贵不贵?
GPT-6 Astra的API标准价格并不算便宜,目前输入价格为10美元/百万Token,输出价格为50美元/百万Token,缓存输入则为1美元/百万Token。对于超过272K输入Token的超长上下文请求,还会按照更高的长上下文价格计算。因此,如果只是日常聊天、翻译、写标题或者简单总结,直接使用GPT-6 Astra并不划算。
但如果把它放到AI Agent和复杂编程任务中,价格就需要换一种方式计算。比如让模型读取完整项目、分析代码结构、修改几十个文件、运行测试、定位Bug并最终交付,这类任务虽然会消耗更多Token,但如果能够明显减少开发者数小时甚至数天的人工工作,那么单纯比较“每百万Token多少钱”就没有太大意义。Agent模型真正需要衡量的,是完成一次完整任务的综合成本。
所以,GPT-6 Astra并不是“越贵越应该一直用”的模型。真正合理的方式是让不同模型承担不同难度的任务:简单任务使用低成本模型,复杂推理、代码开发和长程Agent任务再交给GPT-6 Astra。
这样才能在模型能力与API成本之间找到更合理的平衡,对于Agent来说,最终真正应该计算的其实不是**“100万Token多少钱”**,而是:
“完成一个完整任务,需要花多少钱,以及能替我节省多少人工时间?”
这才是判断GPT-6 Astra API价格到底贵不贵的关键。
GPT-6 Astra真正改变的,可能不是模型,而是“人与电脑的关系”
过去的软件使用逻辑非常简单:人学习软件 → 人操作软件 → 软件执行命令。用户必须理解菜单、按钮、工具和操作流程,然后一步步完成任务。而GPT-6 Astra所代表的方向,则开始转向**“人提出目标 → AI理解目标 → AI操作软件 → AI完成任务”**。在这种模式下,用户不一定需要掌握软件的全部操作细节,而是可以直接告诉AI最终想达到什么效果。
如果AI能够进一步操作Photoshop、Blender、CAD、Excel、浏览器、IDE以及企业内部系统,那么软件未来的竞争方式也可能发生变化。软件厂商除了需要考虑功能是否丰富、界面是否好用之外,还需要思考一个新的问题:AI能不能理解这些功能,并且真正使用它们完成任务?这意味着软件可能逐渐从单纯服务人的Human Interface,走向同时服务人和AI的Human + AI Interface。
因此,未来真正优秀的软件,可能不只是“功能更多的软件”,而是更容易被AI理解、调用和自动化的软件。对于Photoshop、Blender、CAD、Excel、IDE以及各种企业软件来说,这甚至可能成为下一阶段产品设计的重要方向:软件不再只是给人使用,也需要开始为AI准备接口和工作能力。
结语:GPT-6 Astra真正可怕的,不是99.9%,而是它开始“动手”
GPT-6 Astra这次最值得关注的,并不是ARC-AGI-3 99.9%这样的数字,而是AI正在从“回答问题”进入“执行任务”的阶段。OpenAI已经把推理、代码、浏览器、Computer Use、文件、MCP以及各种工具能力组合到一个模型体系里,让AI能够更加完整地参与真实工作。
如果说过去的大模型是在努力成为一个更聪明的大脑,那么GPT-6 Astra正在尝试解决另一个问题:如何让这个大脑拥有操作电脑和完成工作的“手”。
从写代码,到操作浏览器,再到CAD、数据分析和专业软件,AI的竞争正在从“谁更会说”逐渐转向“谁真正能把事情做完”。这可能才是GPT-6 Astra发布之后,最值得普通用户和开发者关注的变化。


![年底收官巨献,AIGC行业全平台设计工具网站正式上线,助力创作者突破创作瓶颈,开启高效创作之旅[已下线]-MOHE素材库-设计行业的乐园,各类素材的矿山!](https://www.mohe-sc.com/wp-content/uploads/2024/12/Ai.turnfish.top_-800x450.jpg)





![百度网盘直链解析彻底解除百度云限速限制[利用IDM工具在线解析网页版]-MOHE素材库-设计行业的乐园,各类素材的矿山!](http://mohe-sc.com/wp-content/uploads/2021/07/baiduwangpan-400x273.png)








暂无评论内容