0风景0
09-05
AGI又又又又来了
[开心]
全球最强GPT-6 Astra来了!人类进入AGI时代
免责声明:上述内容仅代表发帖人个人观点,不构成本平台的任何投资建议。
分享至
微信
复制链接
精彩评论
我们需要你的真知灼见来填补这片空白
打开APP,发表看法
APP内打开
发表看法
1
{"i18n":{"language":"zh_CN"},"detailType":1,"isChannel":false,"data":{"magic":2,"id":604413404341152,"tweetId":"604413404341152","gmtCreate":1788598852848,"gmtModify":1788604060816,"author":{"id":3517468493504389,"idStr":"3517468493504389","authorId":3517468493504389,"authorIdStr":"3517468493504389","name":"0风景0","avatar":"https://static.laohu8.com/default-avatar.jpg","vip":1,"userType":1,"introduction":"","boolIsFan":false,"boolIsHead":false,"crmLevel":1,"crmLevelSwitch":0,"individualDisplayBadges":[],"wearingBadges":[],"fanSize":0,"starInvestorFlag":false},"themes":[],"images":[],"coverImages":[],"title":"","html":"<html><head></head><body><p>AGI又又又又来了<span>[开心] </span> </p></body></html>","htmlText":"<html><head></head><body><p>AGI又又又又来了<span>[开心] </span> </p></body></html>","text":"AGI又又又又来了[开心]","highlighted":1,"essential":1,"paper":1,"likeSize":1,"commentSize":0,"repostSize":0,"favoriteSize":0,"link":"https://laohu8.com/post/604413404341152","repostId":2664201802,"repostType":2,"repost":{"id":"2664201802","kind":"news","pubTimestamp":1788597900,"share":"https://www.laohunote.com/m/news/2664201802?lang=zh_CN&edition=full","pubTime":"2026-09-05 16:45","market":"fut","language":"zh","title":"全球最强GPT-6 Astra来了!人类进入AGI时代","url":"https://stock-news.laohu8.com/highlight/detail?id=2664201802","media":"新智元","summary":"近日,OpenAI重磅官宣下一代旗舰模型GPT-6 Astra。从5到6,GPT-6 Astra不仅是版本号的一次跨越,更是OpenAI史上最具里程碑意义的跃迁。GPT-6 Astra震撼登场AGI时代来了在各项基准测试中,OpenAI官博中多次重用了一个词——「饱和」。这足以证明,GPT-6 Astra在多个领域的「绝对统治力」,榜单已测不出它的上限了。GPT-6 Astra直接把Claude 5.1死死踩在了脚下,全方位、无死角。OpenAI自称,GPT6 Astra是迄今为止最适合软件工程的模型。","content":"<html><head></head><body><p>近日,OpenAI重磅官宣下一代旗舰模型GPT-6 Astra。</p><p class=\"t-img-caption\"><img src=\"https://static.tigerbbs.com/49a086bdd9f7799c3a48e8d815a695a0\" alt=\"\" title=\"\" tg-width=\"1080\" tg-height=\"252\"/></p><p>官方将其定义为,「<strong>世界上最智能、对齐程度最高</strong>」的模型。</p><p>它在计算机使用、浏览、软件工程、网络安全、科学和专业工作领域,全部刷新SOTA。</p><p>发布会上,总裁Greg Brockman更是毫不掩饰地宣布——</p><p><strong>OpenAI已经实现了AGI!Welcome to the AGI era(欢迎来到AGI时代)!</strong></p><p>他更是直言,「在我看来,<strong>世界正式步入AGI时代,也就是AI的综合智力彻底碾压人类了」</strong>。</p><p>全人类苦等已久的AGI时刻,终于在今天彻底降临!</p><p>从5到6,GPT-6 Astra不仅是版本号的一次跨越,更是OpenAI史上最具里程碑意义的跃迁。</p><p class=\"t-img-caption\"><img src=\"https://static.tigerbbs.com/5dc32af204339e2f1e98c6a7c7239301\" alt=\"\" title=\"\" tg-width=\"1080\" tg-height=\"675\"/></p><p>直接划重点,GPT-6 Astra终极杀手锏全在这儿了——</p><ul style=\"\"><li><p><strong>各项天花板级基准彻底被「打爆」:</strong>FrontierMath Tier 4得分97.6%(逼近98%饱和线),ARC-AGI-3飙出惊人的99.9%,ExploitBench漏洞利用拿下100%满分;</p></li><li><p><strong>「计算机使用」代际飞跃:</strong>Astra可以完成你在电脑上能做的任何事,速度飞快;</p></li><li><p><strong>训练史上最大算力:</strong>GPT-6 Astra爆出动用了OpenAI迄今为止最大算力,超10万块GPU;</p></li><li><p><strong>AI亲自训练AI:</strong>这是OpenAI首款在「训练监督」中由先前AI模型发挥重要作用的模型;</p></li><li><p><strong>价格:</strong>输入10美元每百万Token,输出50美元每百万Token。</p></li></ul><p class=\"t-img-caption\"><img src=\"https://static.tigerbbs.com/c8d60c5532ba2f8cd9289a9e78bd811f\" alt=\"来源:@rickawsb整理\" title=\"来源:@rickawsb整理\" tg-width=\"1080\" tg-height=\"741\"/><span>来源:@rickawsb整理</span></p><p>一点小遗憾,GPT-6 Astra还得再等等。</p><p class=\"t-img-caption\"><img src=\"https://static.tigerbbs.com/782f94a678fbbf9096e5ad9e55a8ab90\" alt=\"\" title=\"\" tg-width=\"1080\" tg-height=\"143\"/></p><p><strong>GPT-6 Astra震撼登场</strong></p><p><strong>AGI时代来了</strong></p><p>在各项基准测试中,OpenAI官博中多次重用了一个词——<strong>「饱和」</strong>(saturate)。</p><p>这足以证明,GPT-6 Astra在多个领域的「绝对统治力」,榜单已测不出它的上限了。</p><p class=\"t-img-caption\"><img src=\"https://static.tigerbbs.com/49f6d963fc2ca1c7de310a88d407edf0\" alt=\"\" title=\"\" tg-width=\"1080\" tg-height=\"474\"/></p><p>总榜上,刚刚上线的Claude Fable 5.1,已经没有什么优势可言了。</p><p>GPT-6 Astra直接把Claude 5.1死死踩在了脚下,全方位、无死角。</p><p class=\"t-img-caption\"><img src=\"https://static.tigerbbs.com/16522a3e3f7524ed19448f9fd8e9382c\" alt=\"\" title=\"\" tg-width=\"1080\" tg-height=\"608\"/></p><p>先来看<strong>ARC-AGI-3</strong>,Astra直接拿下<strong>99.9%</strong>,暴击Claude Opus 5(30.2%)。</p><p>这个测试考的是,Agent在陌生的互动式任务里边玩边学的能力,人类测试者平均只有48%。</p><p>OpenAI估算,在同样的responses API评测框架下,Sol只有30%左右,Astra直线刷爆。</p><p class=\"t-img-caption\"><img src=\"https://static.tigerbbs.com/9da0b0a0f67755a48fd1f1db2e372170\" alt=\"\" title=\"\" tg-width=\"1080\" tg-height=\"1201\"/></p><p class=\"t-img-caption\"><img src=\"https://static.tigerbbs.com/f180ad1b46b5b5e74247823fb913f046\" alt=\"\" title=\"\" tg-width=\"1080\" tg-height=\"779\"/></p><p>数学上,Astra在<strong>FrontierMath Tier 4 v2</strong>达到97.6%(接近98%饱和分)。</p><p>这是当前最难的数学测试集,被公认为人类顶尖数学家的难题高地。</p><p>在测试生物、化学和物理领域的研究生级科学推理<strong>GPQA Diamond</strong>,Astra同样刷新历史新高。</p><p>即便在较低算力成本设置下,亦能跑出94.9%,远超 GPT-5.6 Sol(94.6%),且API预估成本下降约37%。</p><table style=\"border-collapse: collapse;\"><tbody><tr><td data-colwidth=\"287\" style=\"text-align: left; width: 287px;\"><p class=\"t-img-caption\"><img src=\"https://static.tigerbbs.com/78c8d5af87294cc441eaca184d9d7447\" alt=\"\" title=\"\" tg-width=\"1080\" tg-height=\"921\"/></p></td><td data-colwidth=\"287\" style=\"text-align: left; width: 287px;\"><p class=\"t-img-caption\"><img src=\"https://static.tigerbbs.com/3b25935688bf7556bae2d47867de5f42\" alt=\"\" title=\"\" tg-width=\"1080\" tg-height=\"825\"/></p></td></tr></tbody></table><p></p><p><strong>编程第一,Fable 5.1惨败</strong></p><p>编程,依然是Astra的主战场。</p><p>OpenAI自称,GPT‑6 Astra是迄今为止最适合软件工程的模型。</p><p>Terminal-Bench 4.0上,Astra拿到57.7%,GPT-5.6 Sol为37.3%,Claude Fable 5.1为55.8%。</p><p>DeepSWE v1.1上,Astra达到74.1%;内部数据库迁移任务达到63.9%,相比Sol的42.7%提升明显。</p><table style=\"border-collapse: collapse;\"><tbody><tr><td data-colwidth=\"287\" style=\"text-align: left; width: 287px;\"><p class=\"t-img-caption\"><img src=\"https://static.tigerbbs.com/7f0b6ae662bc212f24facbe4cb11858c\" alt=\"\" title=\"\" tg-width=\"1080\" tg-height=\"825\"/></p></td><td data-colwidth=\"287\" style=\"text-align: left; width: 287px;\"><p class=\"t-img-caption\"><img src=\"https://static.tigerbbs.com/3a2cdce3b6051c1bc569cfb7baa15984\" alt=\"\" title=\"\" tg-width=\"1080\" tg-height=\"825\"/></p></td></tr></tbody></table><p>比跑分更关键的升级,藏在Codex的上下文管理里。</p><p>过去,长任务一旦塞满上下文窗口,模型会把历史压缩成摘要。每压缩一次,都可能丢掉一些细节:某次修复为何失败、一个模块有什么特殊行为、用户最初设下了哪些限制。</p><p>这一次,Astra新增了跨上下文窗口的笔记与检索机制。</p><p>它会保存一路积累的关键信息,早期窗口也保持可搜索。即使某条测试结果没有被写进摘要,模型仍能从过去的消息和工具输出中把它找回来。</p><p>OpenAI开始给长时间运行的智能体补上一套外部记忆:重点内容主动记,完整历史需要时再搜。</p><p>对持续数小时、跨越大量文件的重构任务,这种能力可能比单次代码生成得分更重要。</p><p class=\"t-img-caption\"><img src=\"https://static.tigerbbs.com/ca913b52d1b6f3c67756c2b1075ec696\" alt=\"\" title=\"\" tg-width=\"877\" tg-height=\"1234\"/></p><p><strong>全球最强「计算机使用」模型</strong></p><p>但真正让Astra与上一代模型拉开距离的,是「计算机使用」的能力。</p><p>OpenAI把Astra称为,世界上最好的计算机使用模型。</p><p>奥特曼之前反复强调,下一代最让他兴奋的,就是这一功能。他直言:Astra计算机使用能力,已达人类水平。</p><p>如今,GPT-6 Astra已彻底进化为一个坐在电脑前、手握键鼠的「超级专家」。</p><p>OpenAI放了一段15秒的浓缩视频:Astra在KiCad里做PCB布局。</p><p>Astra打开KiCad,从电路原理图开始摆放元器件、规划走线,最终完成一块可制造的PCB。</p><p>电路板布局长期依赖工程师手工调整,一个位置、一根铜线出错,都可能把问题带进后续打样。</p><p>现在,这类工作第一次被放进了通用模型的任务范围。</p><p class=\"t-img-caption\"><img src=\"https://static.tigerbbs.com/1de9ec5908eb2f56269bc9f7a3cf420a\" alt=\"\" title=\"\" tg-width=\"960\" tg-height=\"480\"/></p><p>它还填了一份美国1040报税表,给法律文件排了版,在Power BI里做报表,给一个网站跑了前端QA。</p><p class=\"t-img-caption\"><img src=\"https://static.tigerbbs.com/8743e5cac33c0c7549b7a2dbc9186aa0\" alt=\"\" title=\"\" tg-width=\"1080\" tg-height=\"551\"/></p><p class=\"t-img-caption\"><img src=\"https://static.tigerbbs.com/0683ddcf158c65a37ed6ff577153f54a\" alt=\"\" title=\"\" tg-width=\"1079\" tg-height=\"605\"/></p><p><strong>Agents' Last Exam</strong>,测真实软件里的专业任务,从财务建模到工程制图。Astra得分59.3%,赶超Claude Opus 5(55.5%)和GPT-5.6 Sol(53.6%)。在最高分设置下,它使用的输出Token还比Opus 5少约65%。</p><p><strong>OSWorld 2.0</strong>,模拟真人操作电脑。上一代GPT-5.6 Sol一个任务平均要75分钟,Astra仅40分钟,分数还从65.7%涨到72.6%。性能更高,单项任务耗时缩短约47%。</p><p>配合新版Codex harness,在Mind2Web上,网页任务比Sol快1.9倍。</p><table style=\"border-collapse: collapse;\"><tbody><tr><td data-colwidth=\"287\" style=\"text-align: left; width: 287px;\"><p class=\"t-img-caption\"><img src=\"https://static.tigerbbs.com/57afc48bb3e60889d1ecbb009fdcac53\" alt=\"\" title=\"\" tg-width=\"1080\" tg-height=\"883\"/></p></td><td data-colwidth=\"287\" style=\"text-align: left; width: 287px;\"><p class=\"t-img-caption\"><img src=\"https://static.tigerbbs.com/9ada07b24690929784db88230ab19210\" alt=\"\" title=\"\" tg-width=\"1080\" tg-height=\"825\"/></p></td></tr></tbody></table><p></p><p><strong>画CAD、建网站,一次交付</strong></p><p>在知识型工作上,GPT-6 Astra又是一次重大变革。</p><p>Astra接受过针对办公与专业环境的训练,可以执行多步骤工作流,并直接生成文档、表格和演示文稿。</p><p>在<strong>AutomationBench</strong>上,它从GPT-5.6 Sol的18.1%跃升至41.4%,也超过Claude Fable 5.1的31.4%。</p><p>在<strong>BenchCAD</strong>中,模型需要根据多个视角的渲染图,用代码重建3D物体。</p><p>Astra配合工具拿到95.9%的几何重合度,GPT-5.6 Sol为83.3%,Claude Fable 5.1为84.3%。按照OpenAI给出的测试配置,Astra的估算API成本比Sol低约43%,比Fable 5.1低约86%。</p><p class=\"t-img-caption\"><img src=\"https://static.tigerbbs.com/aa370c876acb486ed780d980c2737688\" alt=\"\" title=\"\" tg-width=\"1080\" tg-height=\"863\"/></p><p>Astra对企业模板的理解也更强了。</p><p>给它几页公司的既有PPT,Astra可以延续版式、语气和叙事结构,把后面的整套演示文稿补出来。</p><p>文档和表格也一样:它会抓取真正相关的上下文,尽量删掉无关复述,让结果贴近企业原有的写作与视觉规范。</p><p class=\"t-img-caption\"><img src=\"https://static.tigerbbs.com/ba3ad87aec0e1810a6a2597ed3bba999\" tg-width=\"1078\" tg-height=\"426\"/></p><p>GPT‑6 Astra还为其构建的网站、游戏、应用程序和渲染图带来了更强的视觉判断力。</p><p>Astra先在Blender里搭出一栋房子,再把它送进Unreal Engine 5,变成可以自由行走的场景。</p><p>通过ChatGPT中的Sites功能,Astra可以直接根据提示词创建、托管和分享网站、网页应用及游戏。</p><p class=\"t-img-caption\"><img src=\"https://static.tigerbbs.com/871dc6056b4d594b1fdbede3d47a90e2\" tg-width=\"640\" tg-height=\"360\"/></p><p>这里还有一个很容易被忽略的变化:Astra更会判断什么时候该问人。</p><p>指令里只缺少常规细节,它会结合上下文补齐;某个选择足以改变结果,它会提出一个聚焦的问题。</p><p>在Codex中,它可以异步询问,同时继续完成不依赖答案的部分。用户暂时没回复,它会在低风险环节采用合理假设;碰到关键决策,则停下来等人确认。</p><p class=\"t-img-caption\"><img src=\"https://static.tigerbbs.com/46a8f74a79381258a599059cb0a75c31\" tg-width=\"1080\" tg-height=\"507\"/></p><p class=\"t-img-caption\"><img src=\"https://static.tigerbbs.com/9d8d1a9aaae277618599c3d6271eb9c3\" tg-width=\"1080\" tg-height=\"507\"/></p><p><strong>攻入科研,改写两个素数世界纪录</strong></p><p>Astra在科研上的进展,同样凶猛。</p><p>Astra之前就已经帮人类解决了十个「菲尔兹奖级别」的数学难题,这次OpenAI又顺手放出两个关于「素数间隙」的新结果。</p><p><strong>第一个研究「相邻素数可以有多近」。</strong></p><p>十多年来,已知结论是存在无穷多对素数,间距不超过246。数学家Julia Stadlmann近期把它改进到240,Astra又进一步推到186。</p><p><strong>第二个研究「素数之间可以有多远」。</strong></p><p>Astra改进了一个80多年没有变化的界中项。</p><p class=\"t-img-caption\"><img src=\"https://static.tigerbbs.com/54b08849f670dd9b9b9c81d157f06a8c\" tg-width=\"1080\" tg-height=\"1197\"/></p><p>科研的另一个变化,是推理能力开始与「计算机使用」合流。</p><p>Astra直接进入专业科学软件,检查测序质量、可视化遗传变异、跟踪细胞运动。它既给出判断,也完成数据探索所需的具体操作。</p><p class=\"t-img-caption\"><img src=\"https://static.tigerbbs.com/758edb698713baed626b5407d6224f7d\" tg-width=\"1079\" tg-height=\"601\"/></p><p class=\"t-img-caption\"><img src=\"https://static.tigerbbs.com/4976c4019377cd626d61d0123651fad7\" tg-width=\"1079\" tg-height=\"601\"/></p><p><strong>OpenAI 首个「Critical」级模型</strong></p><p>GPT-6 Astra这次没有直接放出来,与它强大的「网络安全」能力,有非常紧密的联系。</p><p>按照OpenAI的Preparedness Framework,Astra已经达到网络安全的「Critical」阈值。</p><p><strong>这是OpenAI史上第一个,被正式判定达到Critical网络安全能力的模型。</strong></p><p>Critical意味着,模型能在基本无人协助的情况下,自己找出加固过的系统里的未知漏洞,并写出能用的利用代码。</p><p>内部测试中,OpenAI甚至发现了两个此前未知的day0漏洞,因此最强的网络安全能力暂时不会完全开放。</p><p>目前Astra先向Daybreak Access少量机构开放,ChatGPT Plus、Pro、Business、Enterprise和API用户将在未来几天可用。</p><p><strong>十万块GPU训练,AI递归自我改进</strong></p><p>最值得看的,是GPT-6 Astra训练背后的豪华配置。</p><p>GPT-6 Astra这头巨兽,已经强到没有任何对手。</p><p>正是因为,OpenAI为Astra动用了迄今规模最大的训练任务,在得州「星际之门」超算使用超10万块GPU。</p><p>而且,这一次的训练方式,也是有所不同。</p><p>OpenAI训练副总Aidan Clark透露——</p><p>这是OpenAI首款由此前模型,在训练监督(Training Supervision)中发挥重要作用的前沿模型。</p><p>到Astra训练后期,系统可以自主连续运行大半天;即便出现问题,AI往往几秒后就能让训练继续推进。</p><p>这也是OpenAI史上第一次,AI开始参与维护训练AI的系统。</p><p>这一刻,可以称之为「递归式自我改进」(RSI)的雏形。</p><p>一旦这条链路继续扩大,模型迭代速度的限制,就会从人类工程团队的工作时长,转向算力、实验设计和安全验证。</p><p>如果这条路跑通,Astra就不只是一座AGI里程碑。从它开始,OpenAI将迈向ASI的真正拐点。</p><p>要认识到,Astra根本不是终点,仅仅是个开端。 </p><p>毫不夸张地说,今天,才是真正意义上AI诞生的第一天。大模型已经全面进入了RSI竞争时代</p><p class=\"t-img-caption\"><img src=\"https://static.tigerbbs.com/3c05211695c7c85a99917eec647498a0\" tg-width=\"1080\" tg-height=\"257\"/></p><p>就像《2001太空漫游》里穿越星际之门降临的「星孩」,AGI终于在人类的注视下破茧而出。 </p><p>这一刻,图灵跨越半个多世纪的终极梦想,彻底成真了。</p></body></html>","source":"lsy1569730104218","collect":0,"html":"<!DOCTYPE html>\n<html>\n<head>\n<meta http-equiv=\"Content-Type\" content=\"text/html; charset=utf-8\" />\n<meta name=\"viewport\" content=\"width=device-width,initial-scale=1.0,minimum-scale=1.0,maximum-scale=1.0,user-scalable=no\"/>\n<meta name=\"format-detection\" content=\"telephone=no,email=no,address=no\" />\n<title>全球最强GPT-6 Astra来了!人类进入AGI时代</title>\n<style type=\"text/css\">\na,abbr,acronym,address,applet,article,aside,audio,b,big,blockquote,body,canvas,caption,center,cite,code,dd,del,details,dfn,div,dl,dt,\nem,embed,fieldset,figcaption,figure,footer,form,h1,h2,h3,h4,h5,h6,header,hgroup,html,i,iframe,img,ins,kbd,label,legend,li,mark,menu,nav,\nobject,ol,output,p,pre,q,ruby,s,samp,section,small,span,strike,strong,sub,summary,sup,table,tbody,td,tfoot,th,thead,time,tr,tt,u,ul,var,video{ font:inherit;margin:0;padding:0;vertical-align:baseline;border:0 }\nbody{ font-size:16px; line-height:1.5; color:#999; background:transparent; }\n.wrapper{ overflow:hidden;word-break:break-all;padding:10px; }\nh1,h2{ font-weight:normal; line-height:1.35; margin-bottom:.6em; }\nh3,h4,h5,h6{ line-height:1.35; margin-bottom:1em; }\nh1{ font-size:24px; }\nh2{ font-size:20px; }\nh3{ font-size:18px; }\nh4{ font-size:16px; }\nh5{ font-size:14px; }\nh6{ font-size:12px; }\np,ul,ol,blockquote,dl,table{ margin:1.2em 0; }\nul,ol{ margin-left:2em; }\nul{ list-style:disc; }\nol{ list-style:decimal; }\nli,li p{ margin:10px 0;}\nimg{ max-width:100%;display:block;margin:0 auto 1em; }\nblockquote{ color:#B5B2B1; border-left:3px solid #aaa; padding:1em; }\nstrong,b{font-weight:bold;}\nem,i{font-style:italic;}\ntable{ width:100%;border-collapse:collapse;border-spacing:1px;margin:1em 0;font-size:.9em; }\nth,td{ padding:5px;text-align:left;border:1px solid #aaa; }\nth{ font-weight:bold;background:#5d5d5d; }\n.symbol-link{font-weight:bold;}\n/* header{ border-bottom:1px solid #494756; } */\n.title{ margin:0 0 8px;line-height:1.3;color:#ddd; }\n.meta {color:#5e5c6d;font-size:13px;margin:0 0 .5em; }\na{text-decoration:none; color:#2a4b87;}\n.meta .head { display: inline-block; overflow: hidden}\n.head .h-thumb { width: 30px; height: 30px; margin: 0; padding: 0; border-radius: 50%; float: left;}\n.head .h-content { margin: 0; padding: 0 0 0 9px; float: left;}\n.head .h-name {font-size: 13px; color: #eee; margin: 0;}\n.head .h-time {font-size: 11px; color: #7E829C; margin: 0;line-height: 11px;}\n.small {font-size: 12.5px; display: inline-block; transform: scale(0.9); -webkit-transform: scale(0.9); transform-origin: left; -webkit-transform-origin: left;}\n.smaller {font-size: 12.5px; display: inline-block; transform: scale(0.8); -webkit-transform: scale(0.8); transform-origin: left; -webkit-transform-origin: left;}\n.bt-text {font-size: 12px;margin: 1.5em 0 0 0}\n.bt-text p {margin: 0}\n</style>\n</head>\n<body>\n<div class=\"wrapper\">\n<header>\n<h2 class=\"title\">\n全球最强GPT-6 Astra来了!人类进入AGI时代\n</h2>\n\n<h4 class=\"meta\">\n\n\n2026-09-05 16:45 北京时间 <a href=https://mp.weixin.qq.com/s/UXYa2sY-Nj8OCInEZm_DSA><strong>新智元</strong></a>\n\n\n</h4>\n\n</header>\n<article>\n<div>\n<p>近日,OpenAI重磅官宣下一代旗舰模型GPT-6 Astra。官方将其定义为,「世界上最智能、对齐程度最高」的模型。它在计算机使用、浏览、软件工程、网络安全、科学和专业工作领域,全部刷新SOTA。发布会上,总裁Greg Brockman更是毫不掩饰地宣布——OpenAI已经实现了AGI!Welcome to the AGI era(欢迎来到AGI时代)!他更是直言,「在我看来,世界正式步入AGI...</p>\n\n<a href=\"https://mp.weixin.qq.com/s/UXYa2sY-Nj8OCInEZm_DSA\">网页链接</a>\n\n</div>\n\n\n</article>\n</div>\n</body>\n</html>\n","type":0,"thumbnail":"https://static.tigerbbs.com/14b28f6461f0587dab43c63175ed92f3","relate_stocks":{},"source_url":"https://mp.weixin.qq.com/s/UXYa2sY-Nj8OCInEZm_DSA","is_english":false,"share_image_url":"https://static.laohu8.com/e9f99090a1c2ed51c021029395664489","article_id":"2664201802","content_text":"近日,OpenAI重磅官宣下一代旗舰模型GPT-6 Astra。官方将其定义为,「世界上最智能、对齐程度最高」的模型。它在计算机使用、浏览、软件工程、网络安全、科学和专业工作领域,全部刷新SOTA。发布会上,总裁Greg Brockman更是毫不掩饰地宣布——OpenAI已经实现了AGI!Welcome to the AGI era(欢迎来到AGI时代)!他更是直言,「在我看来,世界正式步入AGI时代,也就是AI的综合智力彻底碾压人类了」。全人类苦等已久的AGI时刻,终于在今天彻底降临!从5到6,GPT-6 Astra不仅是版本号的一次跨越,更是OpenAI史上最具里程碑意义的跃迁。直接划重点,GPT-6 Astra终极杀手锏全在这儿了——各项天花板级基准彻底被「打爆」:FrontierMath Tier 4得分97.6%(逼近98%饱和线),ARC-AGI-3飙出惊人的99.9%,ExploitBench漏洞利用拿下100%满分;「计算机使用」代际飞跃:Astra可以完成你在电脑上能做的任何事,速度飞快;训练史上最大算力:GPT-6 Astra爆出动用了OpenAI迄今为止最大算力,超10万块GPU;AI亲自训练AI:这是OpenAI首款在「训练监督」中由先前AI模型发挥重要作用的模型;价格:输入10美元每百万Token,输出50美元每百万Token。来源:@rickawsb整理一点小遗憾,GPT-6 Astra还得再等等。GPT-6 Astra震撼登场AGI时代来了在各项基准测试中,OpenAI官博中多次重用了一个词——「饱和」(saturate)。这足以证明,GPT-6 Astra在多个领域的「绝对统治力」,榜单已测不出它的上限了。总榜上,刚刚上线的Claude Fable 5.1,已经没有什么优势可言了。GPT-6 Astra直接把Claude 5.1死死踩在了脚下,全方位、无死角。先来看ARC-AGI-3,Astra直接拿下99.9%,暴击Claude Opus 5(30.2%)。这个测试考的是,Agent在陌生的互动式任务里边玩边学的能力,人类测试者平均只有48%。OpenAI估算,在同样的responses API评测框架下,Sol只有30%左右,Astra直线刷爆。数学上,Astra在FrontierMath Tier 4 v2达到97.6%(接近98%饱和分)。这是当前最难的数学测试集,被公认为人类顶尖数学家的难题高地。在测试生物、化学和物理领域的研究生级科学推理GPQA Diamond,Astra同样刷新历史新高。即便在较低算力成本设置下,亦能跑出94.9%,远超 GPT-5.6 Sol(94.6%),且API预估成本下降约37%。编程第一,Fable 5.1惨败编程,依然是Astra的主战场。OpenAI自称,GPT‑6 Astra是迄今为止最适合软件工程的模型。Terminal-Bench 4.0上,Astra拿到57.7%,GPT-5.6 Sol为37.3%,Claude Fable 5.1为55.8%。DeepSWE v1.1上,Astra达到74.1%;内部数据库迁移任务达到63.9%,相比Sol的42.7%提升明显。比跑分更关键的升级,藏在Codex的上下文管理里。过去,长任务一旦塞满上下文窗口,模型会把历史压缩成摘要。每压缩一次,都可能丢掉一些细节:某次修复为何失败、一个模块有什么特殊行为、用户最初设下了哪些限制。这一次,Astra新增了跨上下文窗口的笔记与检索机制。它会保存一路积累的关键信息,早期窗口也保持可搜索。即使某条测试结果没有被写进摘要,模型仍能从过去的消息和工具输出中把它找回来。OpenAI开始给长时间运行的智能体补上一套外部记忆:重点内容主动记,完整历史需要时再搜。对持续数小时、跨越大量文件的重构任务,这种能力可能比单次代码生成得分更重要。全球最强「计算机使用」模型但真正让Astra与上一代模型拉开距离的,是「计算机使用」的能力。OpenAI把Astra称为,世界上最好的计算机使用模型。奥特曼之前反复强调,下一代最让他兴奋的,就是这一功能。他直言:Astra计算机使用能力,已达人类水平。如今,GPT-6 Astra已彻底进化为一个坐在电脑前、手握键鼠的「超级专家」。OpenAI放了一段15秒的浓缩视频:Astra在KiCad里做PCB布局。Astra打开KiCad,从电路原理图开始摆放元器件、规划走线,最终完成一块可制造的PCB。电路板布局长期依赖工程师手工调整,一个位置、一根铜线出错,都可能把问题带进后续打样。现在,这类工作第一次被放进了通用模型的任务范围。它还填了一份美国1040报税表,给法律文件排了版,在Power BI里做报表,给一个网站跑了前端QA。Agents' Last Exam,测真实软件里的专业任务,从财务建模到工程制图。Astra得分59.3%,赶超Claude Opus 5(55.5%)和GPT-5.6 Sol(53.6%)。在最高分设置下,它使用的输出Token还比Opus 5少约65%。OSWorld 2.0,模拟真人操作电脑。上一代GPT-5.6 Sol一个任务平均要75分钟,Astra仅40分钟,分数还从65.7%涨到72.6%。性能更高,单项任务耗时缩短约47%。配合新版Codex harness,在Mind2Web上,网页任务比Sol快1.9倍。画CAD、建网站,一次交付在知识型工作上,GPT-6 Astra又是一次重大变革。Astra接受过针对办公与专业环境的训练,可以执行多步骤工作流,并直接生成文档、表格和演示文稿。在AutomationBench上,它从GPT-5.6 Sol的18.1%跃升至41.4%,也超过Claude Fable 5.1的31.4%。在BenchCAD中,模型需要根据多个视角的渲染图,用代码重建3D物体。Astra配合工具拿到95.9%的几何重合度,GPT-5.6 Sol为83.3%,Claude Fable 5.1为84.3%。按照OpenAI给出的测试配置,Astra的估算API成本比Sol低约43%,比Fable 5.1低约86%。Astra对企业模板的理解也更强了。给它几页公司的既有PPT,Astra可以延续版式、语气和叙事结构,把后面的整套演示文稿补出来。文档和表格也一样:它会抓取真正相关的上下文,尽量删掉无关复述,让结果贴近企业原有的写作与视觉规范。GPT‑6 Astra还为其构建的网站、游戏、应用程序和渲染图带来了更强的视觉判断力。Astra先在Blender里搭出一栋房子,再把它送进Unreal Engine 5,变成可以自由行走的场景。通过ChatGPT中的Sites功能,Astra可以直接根据提示词创建、托管和分享网站、网页应用及游戏。这里还有一个很容易被忽略的变化:Astra更会判断什么时候该问人。指令里只缺少常规细节,它会结合上下文补齐;某个选择足以改变结果,它会提出一个聚焦的问题。在Codex中,它可以异步询问,同时继续完成不依赖答案的部分。用户暂时没回复,它会在低风险环节采用合理假设;碰到关键决策,则停下来等人确认。攻入科研,改写两个素数世界纪录Astra在科研上的进展,同样凶猛。Astra之前就已经帮人类解决了十个「菲尔兹奖级别」的数学难题,这次OpenAI又顺手放出两个关于「素数间隙」的新结果。第一个研究「相邻素数可以有多近」。十多年来,已知结论是存在无穷多对素数,间距不超过246。数学家Julia Stadlmann近期把它改进到240,Astra又进一步推到186。第二个研究「素数之间可以有多远」。Astra改进了一个80多年没有变化的界中项。科研的另一个变化,是推理能力开始与「计算机使用」合流。Astra直接进入专业科学软件,检查测序质量、可视化遗传变异、跟踪细胞运动。它既给出判断,也完成数据探索所需的具体操作。OpenAI 首个「Critical」级模型GPT-6 Astra这次没有直接放出来,与它强大的「网络安全」能力,有非常紧密的联系。按照OpenAI的Preparedness Framework,Astra已经达到网络安全的「Critical」阈值。这是OpenAI史上第一个,被正式判定达到Critical网络安全能力的模型。Critical意味着,模型能在基本无人协助的情况下,自己找出加固过的系统里的未知漏洞,并写出能用的利用代码。内部测试中,OpenAI甚至发现了两个此前未知的day0漏洞,因此最强的网络安全能力暂时不会完全开放。目前Astra先向Daybreak Access少量机构开放,ChatGPT Plus、Pro、Business、Enterprise和API用户将在未来几天可用。十万块GPU训练,AI递归自我改进最值得看的,是GPT-6 Astra训练背后的豪华配置。GPT-6 Astra这头巨兽,已经强到没有任何对手。正是因为,OpenAI为Astra动用了迄今规模最大的训练任务,在得州「星际之门」超算使用超10万块GPU。而且,这一次的训练方式,也是有所不同。OpenAI训练副总Aidan Clark透露——这是OpenAI首款由此前模型,在训练监督(Training Supervision)中发挥重要作用的前沿模型。到Astra训练后期,系统可以自主连续运行大半天;即便出现问题,AI往往几秒后就能让训练继续推进。这也是OpenAI史上第一次,AI开始参与维护训练AI的系统。这一刻,可以称之为「递归式自我改进」(RSI)的雏形。一旦这条链路继续扩大,模型迭代速度的限制,就会从人类工程团队的工作时长,转向算力、实验设计和安全验证。如果这条路跑通,Astra就不只是一座AGI里程碑。从它开始,OpenAI将迈向ASI的真正拐点。要认识到,Astra根本不是终点,仅仅是个开端。 毫不夸张地说,今天,才是真正意义上AI诞生的第一天。大模型已经全面进入了RSI竞争时代就像《2001太空漫游》里穿越星际之门降临的「星孩」,AGI终于在人类的注视下破茧而出。 这一刻,图灵跨越半个多世纪的终极梦想,彻底成真了。","news_type":1,"symbols_score_info":{}},"isVote":1,"tweetType":1,"viewCount":83,"commentLimit":10,"likeStatus":false,"favoriteStatus":false,"reportStatus":false,"symbols":[],"verified":2,"subType":0,"readableState":1,"langContent":"CN","currentLanguage":"CN","warmUpFlag":false,"orderFlag":false,"shareable":true,"causeOfNotShareable":"","featuresForAnalytics":[],"commentAndTweetFlag":false,"andRepostAutoSelectedFlag":false,"upFlag":false,"length":21,"optionInvolvedFlag":false,"subscribersOnly":false,"subscribersOnlyAccessible":false,"xxTargetLangEnum":"ZH_CN"},"commentList":[],"isCommentEnd":true,"isTiger":false,"isWeiXinMini":false,"url":"/m/post/604413404341152"}
精彩评论