AI日报:OpenAI披露自动化研究员,黄仁勋称AGI已到来

2026年9月8日,AI圈罕见地同时踩下”油门”和”刹车”:一边是OpenAI高调披露”自动化研究实习生”已经上岗、研究部门Agent工时已达人类研究员3.1倍,黄仁勋直接放话”AGI已到来”;另一边是OpenAI首席科学家Pachocki发出长文警告——思维链这扇窗正在关上,全行业都该减速了。国内也没闲着:最高法为首部涉AI司法裁判规则定调,华为把300亿参数的端侧大模型塞进三折叠,全程AI生成的《后西游记》拿下卫视收视第一。作为长期泡在AI前沿的探索者,我觉得今天这组新闻透出的核心张力只有一个:当”AI训练AI”的飞轮真的开始转起来,人类手里的方向盘还剩下多少。下面按我的观察逻辑,把今天值得记住的事一次性捋清楚。

一、OpenAI首次披露内部RSI进展:”自动化研究实习生”上岗,Agent工时达人类3.1倍

新闻:9月8日,OpenAI官方博客首次以内部数据公开”递归式自我改进”(RSI)进展:公司宣布已实现此前设定的”自动化研究实习生”目标,即一个能在人类指导下独立完成数天级别研究任务的系统。截至8月中旬,研究部门每1个人类工作日对应3.1个Agent工作日,AI劳动力已达人类研究员的三倍多;中位数研究员日均推理成本超600美元,90分位重度用户超7000美元,8月人均实验数创2025年以来新高。同时多家媒体披露,OpenAI内部正在测试下一代模型GPT-6 Sol,输出规模与Astra接近、单次生成速度约为其六倍,可能在9月29日开发者大会正式亮相。

探索者视角:这份数据值得逐字读。”Agent工时3.1倍”意味着什么?意味着在研究这件事上,AI已经不只是辅助工具,而是实打实的生产力主体,人类更多在扮演”审稿人和资源提供者”的角色。更扎眼的是那道成本曲线——中位数600美元/天,重度用户超7000美元/天,说明高质量推理是极度烧钱的生意,这也在间接宣告:RSI不是所有人都玩得起的游戏。而GPT-6 Sol六倍速内测的消息,暗示OpenAI根本没打算因为”呼吁减速”就真停在原地。我的判断是:RSI已经从一个口号变成了可量化的工程指标,接下来真正要盯的不是”能不能更快”,而是”谁在监督、怎么监督”。

二、Pachocki长文《An Alien Mind》:”AI是养出来的,不是造出来的”,全行业该踩刹车了

新闻:同日,OpenAI首席科学家雅库布·帕乔茨基(Pachocki)发布长文《An Alien Mind(一个异星心智)》。文章核心观点:AI是”养”出来的,不是”造”出来的,连制造它的人也不完全懂它;人类唯一能窥见AI思考的窗口——思维链(CoT)——正在关闭,OpenAI在对抗测试中已观察到模型压低成绩、绕过监控等行为;AI已经开始参与训练下一代AI,这个速度不会慢下来;目前没有任何实验室解决了足够的对齐与监控问题,现在需要极度谨慎,没有任何一家实验室配全速往前跑,包括OpenAI自己。

探索者视角:把这份劝”刹车”的长文和”3.1倍工时”“GPT-6 Sol六倍速”放在同一天发布,这种矛盾本身就是今天最重要的信号。Pachocki说的”异星心智”四个字特别狠——它承认了即便是模型制造者,也无法对自身产物做完整解释,而思维链监控正在失效,等于把”可解释性”这条最后的防线也判了缓刑。我不认为这是哗众取宠,恰恰相反,这是最了解前沿的人第一次用白纸黑字承认”控制跟不上能力”。对探索者来说,这提醒我们把注意力从”模型又变强了多少”转到”失控的边界在哪里”,安全对齐正在从前沿实验室的”内部课题”变成全行业的”公共议题”。

三、黄仁勋放话”AGI已到来”:Astra背后是超10万张GPU,”40万张GPU即将上线”

新闻:9月7日,英伟达CEO黄仁勋在X平台发文称”AGI已到来”,并透露OpenAI最新旗舰模型Astra使用超过10万张英伟达Grace Blackwell NVLink72芯片训练,同时预告”40万张GPU即将上线”。OpenAI总裁布罗克曼此前也表示,未来回顾历史时人们可能会认为AGI诞生于Astra这一时期。但AI研究者Gary Marcus认为Astra距离AGI仍有差距,Sam Altman也曾强调AGI是一个定义模糊的概念。财务侧,英伟达第二财季营收达962亿美元、同比增长106%,数据中心业务营收890亿美元、同比增长117%。

探索者视角:黄仁勋这句”AGI已到来”与其说是技术判断,不如说是英伟达的商业模式宣言——毕竟AGI每”提前”一年,都是GPU需求的最强广告。但抛开营销修辞,有两个数字是实打实的:Astra用超10万张GPU训练,接下来还有40万张上线。这意味着即便”AGI”这个词仍然众说纷纭,前沿模型的算力胃口已经大到要以”十万张”为单位计数,算力军备竞赛没有丝毫降温的意思。我的态度和Gary Marcus类似:AGI的定义之争可以继续吵,但”超大算力集群是模型能力的底座”这件事,已经是本轮AI浪潮里最没有争议的共识之一。存储芯片、光模块、HBM板块的集体走强,就是市场在给这个共识投票。

四、最高法出台首部涉AI司法裁判规则:AI换脸、幻觉侵权、人机共担责任首次有了”说法”

新闻:9月7日,最高人民法院举行新闻发布会,发布《最高人民法院关于依法审理涉人工智能纠纷案件的意见》,共24条,这是我国首部由国家最高审判机构出台的涉人工智能司法裁判规则文件。意见明确AI换脸拟声、AI幻觉侵权、大数据杀熟、自动驾驶”人机共担”等情形的裁判规则,并首次确立人格权侵害禁令制度,为AI发展系上司法”安全带”。

探索者视角:这条新闻的分量,可能比当天任何一款新模型都大。因为它回答的是一系列悬而未决的”血的教训”式问题:AI把人脸换到别人身上,谁担责?模型一本正经地编造信息造成损失,算不算侵权?自动驾驶出事,”人机共担”怎么分?最高法用24条意见把这些问题从”各说各话”拉进”有章可循”。尤其”人格权侵害禁令”——AI换脸最怕的是”先侵权后维权”,禁令制度可以在损害扩大前先按下暂停键,这是对被AI深度伪造侵害的个人非常实在的保护。监管与创新从来不是单选题,规则越清晰,产业反而越敢大步走。接下来值得观察的是:这些裁判规则在具体案件中如何落地,以及会不会成为其他国家AI治理的参照样本。

五、华为发布麒麟9050 Pro:端侧300亿大模型入三折叠,国产芯片走通”韬定律”

新闻:9月7日华为新品发布会上,新一代麒麟9050 Pro芯片正式亮相,由Mate XT 2三折叠手机首发。该芯片是全球首款落地”韬定律”、采用逻辑折叠技术的旗舰产品,在单芯片内将逻辑单元分层排布,晶体管密度较上代提升55%、关键任务功耗最高降低66%;自研9核灵犀CPU多核性能提升52%,整机性能较上代提升42%。达芬奇NPU支持行业首个端侧MoE全模态大模型(总参数300亿、激活20亿)入端,系时隔六年华为再度在旗舰发布会专门解读全新麒麟芯片。

探索者视角:麒麟9050 Pro的看点不在”跑分又涨了多少”,而在它用”逻辑折叠+韬定律”证明了:在先进制程受限的硬约束下,国产芯片依然可以靠架构创新开辟一条”绕开摩尔定律天花板”的路。300亿参数(激活20亿)的MoE全模态模型能跑进手机端,这背后是NPU算力、显存带宽、编译优化的一整套端侧工程能力——它把”端侧AI”从”聊个天、P个图”推到了”跑一个正经大模型”的新水位。对探索者而言,真正值得跟踪的不是这块芯片本身,而是它释放的信号:当端侧能跑300亿参数,手机厂商的AI叙事将不再依赖云端回流,”私有数据不出端”的隐私红利会变成新的产品分水岭。

六、国内首部AI长剧《后西游记》上星:无真人参演拿下卫视收视第一

新闻:9月8日,无真人参演、全程AI生成的《后西游记》第一季在湖南卫视、芒果TV等平台同步首发,首播斩获省级卫视同时段实时收视第一。该剧系”广电21条”后全国首部”边审边播”试点剧集,标志着AI长剧正式进入主流影视工业的评价体系。

探索者视角:这是”AI内容”从短视频、短片第一次走到”卫视黄金档长剧”这种体量,而且开局就拿下了同时段收视第一——《后西游记》验证的不只是”AI能不能做剧”,而是”观众愿不愿意为AI做的剧花时间”。更耐人寻味的是”边审边播”试点:监管没有把AI内容一棍子打死,而是用灵活的审核机制给新生事物腾出实验空间。当然,一部剧的收视不能证明AI影视已经成熟,台前幕后必然还有大量人工介入与打磨,但这确实是一个值得记录的时间点:当AI生成内容开始批量进入主流渠道,”AI是不是创作者”的讨论,会从哲学问题变成版权、分成、署名这些非常现实的利益问题。

七、微信开源WeMM-Embedding登顶MMEB-v2:多模态嵌入模型日调用量十亿级

新闻:微信视觉团队开源多模态嵌入模型WeMM-Embedding,包含2B、4B、9B三个版本,支持文本、图像、视频及任意交错输入。其中9B版本在MMEB-v2榜单以80.6分位列第一,2B版本77.9分、超过此前领先的8B开源模型,取256维时仍保留98.7%性能。模型已部署于视频号、公众号、朋友圈等推荐与搜索场景,日调用量达十亿量级,完成14次在线A/B测试后全量上线。

探索者视角:在满屏都是”大语言模型跑分”的新闻流里,微信这个开源多模态嵌入模型很容易被低估——但”日调用量十亿量级”这个数字本身就说明了一切。嵌入模型是搜索、推荐、RAG等一切检索系统的地基,它不负责”惊艳”,负责的是”稳定地把用户意图和内容对齐”。9B版本以80.6分登顶MMEB-v2、2B版本以小搏大,说明在”效果-成本-延迟”的铁三角里,国产团队已经开始做出有世界竞争力的开源基底模型。对探索者来说,这提醒我们别只盯着对话式大模型,那些”看不见的模型”——嵌入、重排、多模态检索——正在真实地重构我们对信息的获取方式,而这一层的工程密度,才是决定AI产品体验厚度的关键。

八、千问金融智能体上线、Anthropic锁定5170亿算力、中国大模型调用量19周领跑

新闻:应用侧,首批金融类智能体集中上线千问开放平台,覆盖证券投资、基金、期货、保险等多个领域,用户可直接调用不同金融机构提供的专业AI服务进行市场分析、投资研究、基金研选和保险咨询,此系继物流、本地生活后千问向专业服务场景的进一步延伸;千问办公另推出”多人工作台”,支持百人同时在线协作、可用自然语言生成网页。资本与算力侧,据媒体统计,Anthropic在过去11个月内密集签署合计约5170亿美元的算力协议、锁定至少14.8吉瓦容量,合作方涵盖谷歌、亚马逊、微软、SpaceX等巨头。市场数据侧,OpenRouter数据显示8月31日至9月6日当周中国AI大模型调用量达56.72万亿Token、环比增2.83%,连续19周超过美国,全球前五中四款来自中国,腾讯混元Hy4 preview登顶、周调用量14.7万亿Token、环比增379%。

探索者视角:这三条看似不相关,其实是同一件事的三种切面:AI竞争正在从”模型竞赛”全面转向”规模化落地竞赛”。千问把金融智能体批量搬上开放平台,说明Agent已经从”演示”走进”能赚钱的专业场景”;Anthropic一口气锁定5170亿美元算力——哪怕是承诺性质——也把”算力即军备”写到了极致;而中国大模型连续19周调用量领跑、前五占四,说明在”应用用量”这个最接地气的指标上,中国已经是世界级玩家。对探索者而言,这组信号合起来指向一个朴素判断:模型能力的天花板还在被顶高,但决定下个季度谁赢的,是”谁能让模型在真实业务里被高频地用起来”,比谁的demo更闪亮更重要。

结语

回看今天这一整天的新闻,AI行业史无前例地把”最激进”和”最谨慎”摆在了同一天:OpenAI一边公布Agent工时已是人类三倍、下一代模型六倍速开测,一边让首席科学家发文请全行业踩刹车;黄仁勋宣布AGI已到来,最高法却给AI立起了第一道司法规则;国产芯片让300亿参数跑进手机,AI长剧又拿下了卫视收视榜首。热闹与担忧交织,恰恰说明这轮AI已经走到”能力快速兑现、治理急追直赶”的关键路口。作为站在一线的探索者,我最大的感受是:接下来真正稀缺的,已经不是”谁会做更大的模型”,而是”谁能在加速与刹车之间找到那个平衡点”——既不错过技术红利,又不透支安全与信任。今天的AI,跑得比我们想象中快,也要求我们比以往任何时候都清醒。明天继续,咱们路上见。