AI日报:OpenAI万智能体攻克千禧难题,ChatGPT Images 2.5登场
2026年9月9日,数学界和AI圈同时发生了一件”本该属于未来”的事:OpenAI官宣约1万个AI智能体协作88小时,攻克了困扰数学界90年的”纳维-斯托克斯千禧年难题”,并且明确表示不申领那100万美元奖金。同一天,ChatGPT Images 2.5正式登场、生图延迟直接砍半;英伟达129.3亿美元收购HuggingFace的落锤声还在回荡;国内DeepSeek开启V4.1 Flash内测、明日全系降价,面壁MiniCPM5-2B登顶开源榜,小米MiMo桌面客户端开放邀测。作为常年泡在AI前沿的探索者,我最大的感受是:AI已经从”回答问题”进化到”替人类做研究”,而这也让”功劳归谁、数据安全、钱怎么算”这些老问题变得前所未有地尖锐。下面按我的观察逻辑,把今天值得记住的事逐一捋清楚。
一、OpenAI约1万智能体88小时攻克千禧年难题:纳维-斯托克斯”奇点”被证出,但不领百万奖金
新闻:9月8日,OpenAI宣布其内部未公开的AI模型(性能据称超越已发布的GPT-6 Astra)成功解决”纳维-斯托克斯存在性与光滑性问题”——克莱数学研究所在2000年提出的七大”千禧年大奖难题”之一,困扰数学界约90年。团队让约1万个AI智能体协作,在约88小时内生成分析证明,随后由GPT-6 Astra在约17小时内完成Lean语言形式化验证。据估算,此次计算成本高达1500万至2250万美元。OpenAI表示不申领该问题100万美元奖金,但事件迅速引发争议:纽约大学数学家Tristan Buckmaster质疑OpenAI在听闻其团队相关进展后才转向”外力驱动”方法,并担心其存储在Codex中的数据被用于训练;OpenAI则回应”不排除”匿名化数据帮助改进了模型。
探索者视角:这条新闻的震撼力在于它把”AI做数学”从”帮人类验算”推进到了”独立发现并证明一个新的数学事实”。1万个智能体、88小时、Lean形式化验证——这套”Agent大军+机器可验证”的流水线,本质是把数学家几十年的智力劳动压缩成一个周末的计算作业。但比起”AI有多强”,我更关心三道争议:一是功劳归属,若干人类数学家的阶段性成果被”参考”,算不算学术伦理问题;二是数据隐私,研究者放在Codex里的私有思考进没进训练语料;三是可解释性,当证明本身复杂到人类难以独立复核,”验证”是否真的等于”理解”。对探索者来说,这是”AI科学家时代”的第一次公开压力测试,它的走向将决定学术界敢不敢把更多顶级难题交给AI。
二、ChatGPT Images 2.5登场:生图延迟最多降50%,Sketch草图、图像内批注、C2PA全程护航
新闻:9月9日,OpenAI官宣发布最强生图模型ChatGPT Images 2.5,在细节锐度、自然光照、纹理丰富度提升的同时,生成延迟最多降低50%。新功能包括:Sketch草图参考(输入@Sketch可在对话中画草图,模型据此补全成图)、海报/商品等创作模板库、图像内评论标注(在图上标位置下指令”删除此区域”“改成蓝色”,仅修改指定区域且多轮编辑不退化)。API侧提供GPT-Image-2.5 Flare(高吞吐量产)与Sunburst(精修编辑)两款模型,支持最高4K横向分辨率。所有输出嵌入C2PA元数据与隐形水印,用于来源溯源与反深度伪造。另据消息,OpenAI还同期开源openai/skills官方Codex技能目录,GitHub星标已超2.6万。
探索者视角:Images 2.5真正有意思的不是”画得更真”,而是两条暗线:一是”编辑控制”——Sketch和区域内批注把生图从”一次生成、不满意重抽”的模式,变成了”像Photoshop一样可局部修改”的迭代式创作,这是图像模型从玩具走向生产工具的关键一跃;二是”溯源合规”——C2PA元数据不再是可选项而是默认项,说明OpenAI在主动配合AI内容治理的国际趋势,这对to B和出版场景是必要的信任背书。叠加openai/skills技能目录的持续走热,”模型+技能包+内容溯源”的完整闭环正在成型。探索者可以这样看:图像生成的下半场,拼的不是一张图的惊艳,而是”改得动、查得到、用得稳”。
三、OpenAI商业化狂飙:企业业务7月年化营收环比+32%,”Agent工时3.1倍”数据继续发酵
新闻:当地时间9月8日,OpenAI首席财务官Sarah Friar在高盛会议上披露,7月企业业务年化营收运行率环比增长32%,高于公司整体年化营收运行率20%的增速;4月时企业业务占公司总营收已超40%,预计年底将与消费者业务规模大致持平。此前OpenAI披露研究部门Agent工时已达人类研究员的3.1倍,本周多家媒体继续跟进”自动化研究实习生”与下一代模型GPT-6 Sol(输出规模接近Astra、速度约为其六倍)的内测传闻,市场普遍预期其将在9月29日开发者大会(OpenAI DevDay)上正式亮相。
探索者视角:32%的企业业务环比增速说明一件事:这轮AI的复购方已经不再是”尝鲜的个人用户”,而是把模型买进生产流程的To B客户——Agent、Codex、企业插件正在变成实打实的订阅收入。结合”Agent工时3.1倍”和”控制跟不上能力”的Pachocki式担忧,我的判断是:OpenAI正处在”收入高速增长”与”安全边界受质疑”的夹缝期,一边是资本市场要财报,一边是学界和监管要约束。对探索者而言,最值得跟踪的信号是9月29日DevDay——如果GPT-6 Sol真的以六倍速登场,那”性能军备竞赛”的下半场开场钟就敲响了,届时要问的就不再是”快不快”,而是”这么快的模型,人类用什么节奏去接”。
四、英伟达129.3亿美元收购HuggingFace:开源分发层被”算力之王”收编,平台承诺保持中立
新闻:9月3日官宣的英伟达收购HuggingFace交易持续是本周焦点:作价高达129.3亿美元,HuggingFace平台承载超300万个模型、50万数据集、100万个应用与1800万开发者——整个开放权重生态几乎都通过其分发。黄仁勋当面承诺:平台将保持开放、中立、独立,不强制要求使用英伟达算力即可构建和部署。9月9日各方仍在关注AMD、Intel等非英伟达算力路径在平台内是否会”实际保持一视同仁”,以及是否有实验室开始将权重镜像到其他渠道。
探索者视角:这笔交易最值得玩味的不是129.3亿美元的单价,而是”开放生态的地基被最大算力厂商买下”这件事本身。短期看,黄仁勋的承诺让开源社区吃下”平台不会关死”的定心丸;但长期看,一个掌控了全球绝大多数训练算力的公司,同时掌控了开源模型的发布与分发渠道,这种”算力+分发”双垄断的想象空间,让不少探索者心里打鼓。开源世界的信条从来是”任何人都能用”,但当”能用”背后连着芯片供应商的供应链账本,”独立”“中立”四个字就需要用一次次实际行动去证明。我会盯两个观察点:一是非英伟达硬件在平台上的体验是否真的一样好,二是有没有重量级实验室开始自建镜像分发。这决定开源生态的”去中心化底色”还能不能保住。
五、DeepSeek V4.1 Flash内测:输出超500 tokens/s明起全系降价,国产模型更新周期重新加速
新闻:9月8日,DeepSeek宣布V4.1 Flash中间版本开启内测:采用新模型结构、原生支持多模态,能力更强、速度更快、成本更低。开发者可保持base_url不变、将模型名设为deepseek-v4.1-flash-expires-on-0910调用,计费与V4 Flash相同,限流20并发,9月10日自动下线。开发者实测最高输出速度达507 tokens/s,多人测试平均超300 tokens/s。同时DeepSeek官方宣布北京时间9月10日12时起调整Flash系列定价,输出降至每百万Token 4元。业内普遍认为,新一轮模型更新与降价周期已经开启。
探索者视角:这条新闻放在今天尤其扎眼——上午OpenAI用1万智能体秀”研究级战力”,下午DeepSeek用500 tokens/s的下游速度秀”平民级性价比”,两个维度的火力叠在一起,恰好勾勒出AI竞争的两条并行曲线:一条向上冲刺能力天花板,一条向下压价格地板。对应用开发者来说,DeepSeek这次”闪电内测+明日即降价”的节奏释放了明确的信号:推理成本还会以月为单位下探,”用得起大模型”正在成为新常态。探索者可以据此调整自己的技术策略——与其追着最强的模型跑,不如盯着”单位成本能换来多少能力”这条更务实的曲线做产品,因为当大家都用得起时,拼的才是工程与场景的真功夫。
六、国产开源与应用侧多点开花:面壁MiniCPM5-2B登顶4B以下开源榜,小米MiMo桌面端开放邀测,腾讯文档上线AI工作台
新闻:9月8日,面壁智能联合OpenBMB开源MiniCPM5-2B高密度端侧语言模型:在Artificial Analysis榜单以23分位列全球4B以下开源模型第一、Agentic Index 20分(同级普遍低于10分),同步开源完整训练配方、自研强化学习框架Meshy、JustRL II算法及4大数据集,被称”L4级真·开源”,MiniCPM系列累计下载量破5000万。同日,小米开放MiMo Desktop桌面客户端邀测:可直接读表格、图片、视频、PDF等素材,内置Smart调度自动匹配模型与执行路径,支持浏览器操控、多会话协同,申请通过可限时体验MiMo-X-Pro-Preview与Flash-Preview两款新一代模型。此外,腾讯文档推出AI工作台,基于WorkBuddy的Agent内核,支持”人机双写”——选中内容用自然语言下指令,改动直接落盘并记入修订记录,后台可执行任务并按条件批量归档文档。
探索者视角:把这三条放一起看,国产AI的竞争已经从”谁的模型跑分高”切换到了”谁的模型能被放下、能用顺手、能进工作流”。面壁用2B参数把”真·开源”做到L4级,说明端侧小模型这条路——不是缩水版,而是用数据与RL配方换来的高密度能力;小米直接把桌面客户端当新战场,把”读素材-拆任务-交付可编辑成果”做成产品体验,走的正是”接管你桌面工作”的Agent路线;腾讯文档则是把Agent塞进最日常的协作场景,用”人机双写”降低一切使用门槛。这三条路代表了端侧落地、桌面Agent、协作软件三种不同的”AI渗透路径”。对探索者来说,别只盯着大模型本身——真正决定AI红利的,是这些”被放下、被用起来”的毛细血管。
七、全球资本狂飙:Cognition E轮20亿美元估值480亿,Mistral D轮30亿欧元创欧洲之最,Meta推个人智能体Muse
新闻:AI编程创企Cognition AI于9月8日宣布完成20亿美元E轮融资,估值达480亿美元,由a16z与Accel领投,Founders Fund等参投;自5月上轮融资以来,其年化收入已从4.92亿美元增至近9亿美元。欧洲侧,法国Mistral AI完成30亿欧元D轮融资,估值超210亿欧元,由三星电子领投,创下欧洲史上最大科技融资纪录,三年估值近翻倍。产品侧,Meta于9月8日面向美国用户推出个人AI智能体Muse:可代执行网购、购票、预约、填表等日常任务,接入Gmail、Google日历、OpenTable、Instagram与WhatsApp;提供免费版及20美元/100美元月付档位,扎克伯格称其为Meta”最大的商业机遇”。
探索者视角:这三条拼在一起,是”AI资本与消费心智”的双重信号。Cognition的480亿估值与Mistral的欧洲之最都在说同一件事:资本市场依然认定”AI编程”和”欧洲独立模型”是稀缺资产,哪怕前期烧钱,估值逻辑也从”用户量”换成了”Agent渗透率”。而Meta的Muse则把战火烧到了”个人生活助理”的最后一公里——要知道Muse要读取邮箱、日历、支付信息和健康数据,这立刻引爆隐私讨论。作为一个探索者,我对Muse的态度是”欢迎之余保持警惕”:个人Agent的兑现价值确实性感,但”一个AI管家手握你全部数字身份”这件事,恰恰是当前数据治理体系最没准备好应付的场景。这一幕一定会成为接下来几个月隐私监管的头号议题,建议持续跟踪它的权限设计与事故记录。
八、产业链与政策共振:亚马逊600亿美元押注高通AI芯片,存储短缺引发手机涨价,工信部培育AI应用服务商
新闻:9月8日,亚马逊与高通宣布多代际合作,共同开发面向AI数据中心的定制化推理芯片与1.6T光互联方案;高通将向亚马逊发行最多2500万股认股权证,采购规模上限达600亿美元。存储侧,韩国券商KB证券指出AI基建投资使三星、SK海力士存储库存不足10天供应量,HBM4扩产持续挤压DRAM产能,预计明年全球头部云厂商AI相关投资达1.3万亿美元、同比增长60%;Counterpoint数据显示2026年全球在售智能手机均价上涨15%,华为、荣耀等相继上调售价200-1000元。政策侧,工信部启动AI应用服务商培育专项行动,目标2026年底服务商资源池突破2000家、2027年底不少于3000家;重庆获批建设国家人工智能产业创新应用先导区,全市已培育各类智能工厂1641个、跨区域可调度智算规模超3万P。此外,北京时间9月9日凌晨苹果秋季发布会举行(iPhone 18 Pro、首款折叠旗舰Ultra与A20 Pro 2nm芯片,新任CEO John Ternus上任后首秀),Apple Intelligence方向备受关注。
探索者视角:今天的产业侧新闻像三条交汇的河流:算力军备(亚马逊+高通挑战英伟达生态、存储涨价)、应用生态(政策端从”建算力”转向”培育服务商”)、终端叙事(苹果2nm+AI、手机涨价)。我最看重的是工信部专项行动这个信号——它说明政策重心正从”堆模型、堆算力”转向”喂应用、喂服务”,而重庆等先导区的落地,意味着”AI产业化”正在变成可考核的地方工程。再看存储涨价与手机涨价,则提醒我们:AI繁荣是有”账单”的——HBM4挤占晶圆产能、云端投资推高芯片价格,这些成本终会传导到普通消费者身上。苹果新CEO首秀带来的A20 Pro 2nm与端侧AI调度,又给”端侧当家”添了把火。对探索者而言,这组新闻的底层共识是:AI正在从”纯技术叙事”变成”供应链+政策+消费”的复合叙事,看行业,得多一只眼睛盯芯片账本,一只眼睛盯政策文件。
结语
回看今天这一天的新闻,最震撼的不是某一款新模型,而是一个”里程碑式的隐喻”:1万个AI智能体用88小时解开了人类90年没解开的数学难题——这意味着AI已经不再只是”工具”,而是开始扮演”共同研究者”甚至”独立发现者”的角色。与此同时,ChatGPT Images 2.5把创作门槛又踩低了一截,英伟达把开源世界的地基收编进自己的版图,DeepSeek和国产厂商把能力与成本的天花板同时往下压。热闹背后,功劳归属、数据隐私、算力垄断、消费定价这些”成长烦恼”也一并浮出水面。作为站在一线的探索者,我最大的体会是:这一轮AI的红利,正在从”谁的模型更强”转向”谁能在速度与治理之间找到平衡”——解得出难题很重要,但让每个人都放心、用得起、算得清账,才决定这波浪潮能走多远。今天的AI快得惊人,也逼着我们想得比它更快。明天继续,咱们路上见。