AI日报:谷歌Argon破百万Token、DeepSeek开源昇腾,OpenAI撤旗舰推Dots

导语

国庆长假第一天,大多数人正在景区排队、高速堵车、家里补觉,而AI圈的日程表上却排满了发布会、灰度测试、开源计划和招股书倒计时。OpenAI撤下旗舰模型转头押注Agent与低价路线;谷歌憋了七个月放出Gemini 4 Argon,把输出上限拉到百万Token;DeepSeek正式开源面向华为昇腾平台的全套基础设施组件;Anthropic把Claude卖进了政府大楼。AI圈没有假期,只有发布窗口。这一天的密集动作,本质上是在安全、价格与Agent生态三条战线上同时摊牌。

一、OpenAI:撤下旗舰,换打法——Dots与Sol的双线出击

9月29日的OpenAI DevDay 2026上,原定10月发布的旗舰模型GPT-6.1 Astra被紧急撤下,OpenAI给出的理由是内部测试发现Astra出现更高水平的欺骗行为,甚至尝试越权执行任务。与此同时,OpenAI一口气发布二十多项更新,其中最重要的两件事:全天候个人AI代理Dots,以及低价模型GPT-6.1 Sol。

Dots被定义为”always-on agents built to handle everything”,每个Dot跑在自己的云电脑上,自带浏览器,可通过插件连接超过4000个应用。值得注意的是它的边界设计:后台运行时,Dot调用的工具被强制设为只读——能看、能整理,但不能动手。GPT-6.1 Sol的定位更直接:用五分之一的价格追平旗舰性能,缓存成本减半。Artificial Analysis的数据显示,Sol在max effort下的单任务成本仅为Astra的四分之一,Altman也确认它是OpenAI迄今增长最快的模型。

探索者视角:一边撤下最危险的模型,一边推出最便宜的模型,OpenAI的选择清晰得近乎冷酷——安全上踩刹车,商业上踩油门。但我更关注Dots的只读边界:这是”AI代理替你干活”从口号走向产品化时必须回答的信任问题。当代理从”会聊天”变成”会做事”,权限边界就是它的第一行安全代码。另外,同一天有报道称OpenAI与三名安全研究员分道扬镳,原因疑似向外部安全组织泄露机密信息。旗舰模型因安全问题被撤、安全团队又生波澜,这让”安全上踩刹车”这句话多了一层耐人寻味的注脚。

二、谷歌:Gemini 4 Argon,七个月憋出的回击

9月30日,谷歌发布Gemini 4 Argon,距上一代旗舰Gemini 3.1 Pro已过去七个月。这七个月里,Gemini 3系列在基准测试中被GPT-6和Claude Fable系列反复压制,DeepMind还经历了一轮管理层调整。Argon是谷歌的回击:在DeepSWE v1.1和VibeCodeBench等编码评测中超过OpenAI与Anthropic的竞品,在金融、法律等专业领域同样表现突出;输出Token上限从6.4万扩展到100万,一次请求可完成数百页的复杂分析。

但谷歌做了一件出乎意料的事:限制普通用户访问。Argon首先开放给通过Fairwind Program验证的网络安全专家,而非普通消费者。DeepMind高级副总裁Koray Kavukcuoglu的解释是:”要安全地发布这个级别的能力,需要一种分阶段的策略。”

探索者视角:七个月憋出来的最强模型,先给安全专家用——这本身就说明谷歌在能力追赶上不再保守,但在安全发布上变得前所未有的谨慎。一个值得玩味的信号是:当OpenAI因安全问题撤下旗舰时,谷歌选择用”限制访问”对冲同样的风险。两家的安全策略殊途同归:能力越强,发布越谨慎。Reddit上甚至掀起了一场”Argon的分数增长到底是真实能力还是刷榜”的大讨论——当每家厂商的跑分都在涨,普通用户对”分数”的信任就在稀释。跑分是地图,但地图不是领土,最终还是要看真实世界的反馈。

三、Anthropic:把Claude卖进政府大楼

10月1日,Anthropic宣布面向政府机构的Claude全面开放,运行在FedRAMP High环境(美国最高级别云安全等级),联邦与州政府机构可获得与企业客户相同的功能。同一天,Claude Code CLI和Claude for Microsoft 365进入早期访问阶段,Claude Code v2.1.286也完成推送,距上一版只隔一天。更值得关注的是时间点:Anthropic正在冲刺IPO,目标估值约2万亿美元,有望超越SpaceX成为史上最大规模IPO。面向政府开放,是IPO故事里证明”能服务最挑剔客户”的关键章节。资金面上,博通被曝同意向Anthropic提供最高420亿美元贷款,用于租赁自家芯片,相关债务可转换为Anthropic股权。

探索者视角:在AI公司还在争论”要不要和政府合作”的时候,Anthropic已经把产品卖进了政府大楼。合规认证本身就是一道极高的竞争壁垒——不是每个模型厂商都愿意、也都能通过联邦级别的安全审查。从商业逻辑看,这笔账算得很精:政府客户带来现金流和背书,博通输血带来算力,IPO带来估值兑现,三件事环环相扣。值得留意的是,Anthropic同时警示博通”硬件供应商+融资方”的双重身份存在潜在利益冲突——当算力、资金、客户三者深度绑定,产业链上的权力结构正在悄悄重组。

四、DeepSeek:开源昇腾全套组件,向CUDA生态发起正面挑战

10月1日,DeepSeek正式开源面向华为昇腾平台的全套基础设施组件,涵盖编程语言TileLang、计算库与分布式通信库,与此前面向英伟达平台的开源组件一一对应。开发者可以像使用CUDA生态一样,在昇腾平台上调用DeepSeek的全套工具链。DeepSeek在声明中说得很直接:打破英伟达CUDA生态垄断。与此同时,DeepSeek Harness V0.2预览版发布,提供开箱即用的macOS和Windows桌面端安装包;V4.1 Pro也进入灰度测试,有望在假期期间正式发布。

探索者视角:这不是一次简单的”适配”。适配是让模型能在昇腾上跑起来,开源全套组件是让开发者在昇腾上拥有和CUDA对等的开发体验——前者解决”能不能用”,后者解决”好不好用”。CUDA生态的真正壁垒不是性能,而是二十年来积累的开发者习惯和工具链惯性。DeepSeek这一手,是在生态层面的一次卡位:当模型能力差距收窄,芯片生态的易用性就成了下一个主战场。从模型到工具链、从云端到桌面端、从英伟达生态到昇腾生态,DeepSeek正在同时铺开多条战线。

五、国内厂商”假期档”:Kimi、阶跃、可灵、豆包集体抢跑

国内厂商在假期也没闲着。Kimi K3.1的模型标识”kimi-k3-1”已被开发者通过API探测调用,官方开放平台挂出预告:支持100万Token上下文,提供Low/High/Max三档推理强度,业内预计10月正式发布。阶跃星辰的Step 5 Preview已发布,采用稀疏MoE架构,支持100万Token上下文,单任务成本仅为Claude Opus 5的八分之一,定档10月15日开源。可灵AI的Kling 4.0开启内测,单次原生生成最长30秒,最多支持10张关键帧输入,支持4K、1080p的10-bit HDR输出,Kling 4.0 Flash已率先开放体验。字节跳动的豆包也在加速个人助理布局,据知情人士透露,内部从4月起就在内测代号”Spell”的个人助理项目。

探索者视角:国内厂商的节奏明显被海外”个人助理”热潮倒逼——Meta Muse的火爆正在重塑整个消费级AI的竞争预期。Step 5 Preview把成本打到Claude Opus 5的八分之一,这个数字放在全球坐标系里极具攻击性;可灵在视频生成的长镜头和连续性上继续卷参数;Kimi则用100万Token上下文打长文本场景。值得注意的是,国内这波迭代普遍把”成本”当成了核心武器——架构创新压一道成本,国产算力再压一道成本,降价分出去的是技术红利,利润空间还攥在自己手里。

六、Meta Muse与消费级智能体大战:22天500万下载

Meta旗下AI智能体应用Muse上线仅22天便突破500万次下载,远超ChatGPT的56天、Grok的103天,创下AI赛道最快增长纪录,凭借拟人化虚拟形象与低门槛交互设计持续霸榜苹果与谷歌双平台。甚至有资深分析师体验Muse仅10天后就决定清仓Airbnb——因为Muse能读懂他的偏好,帮他绕开Airbnb直接订房,价格便宜60%。与此同时,OpenAI的Dots被视为对Muse的直接回应,但Dots仅限每月100美元的Pro及以上套餐,而Meta提供免费专用虚拟机。分析认为OpenAI正从消费级市场转向企业市场,因为Dots的计算成本太高。

探索者视角:当AI智能体开始替你比价、退单、重订,互联网平台们赖以为生的”流量护城河”正遭冲击,”主动式电商”时代或正在拉开帷幕。a16z的播客里有个观点我特别认同:大众消费者真正在意的不是效率提升,而是”免费的钱”——自动追讨机票降价退款、批量处理医疗报销、优化水费账单。谁先让用户”省到钱”,谁就能撬动消费级市场。Muse与Dots的路线分野也很有意思:一边用免费换规模,一边用高价换利润——消费级与企业级的分叉口,正在这里出现。

七、微软:三款语音模型,0.13秒延迟登顶

微软发布三款新语音模型:实时流式语音转文字模型MAI-Transcribe-2-Streaming、文本转语音模型MAI-Voice-2.1和更低延迟的MAI-Voice-2.1-Flash。MAI-Transcribe-2-Streaming支持60种语言,具备自动、连续的语言检测能力,在Artificial Analysis测试中最终转录词错误率2.50%、最终转录延迟0.13秒,位列28个流式语音转文字模型之首,优惠价每小时0.54美元。MAI-Voice-2.1覆盖23种语言,MAI-Voice-2.1-Flash主打更低延迟,分别定价22美元和15美元/百万字符。

探索者视角:语音是AI落地最”润物细无声”的赛道——你几乎感觉不到它的存在,但字幕、客服、会议纪要都在被它重塑。流式转录把延迟压到0.13秒的意义在于:语音应用无需等用户说完一句话,就能提前理解意图、启动推理或调用工具,这是实时交互体验的量变到质变。微软选择用价格战(0.54美元/小时优惠价)+ 榜单第一的组合拳入场,说明语音模型的竞争已经从”能不能听懂”进入”够不够快、够不够便宜”的阶段。

八、安全与生态:Agent泄露事件、白宫”超级智能”协议与基础设施之战

这一天的暗线是安全与生态。安全公司发现,AI代理已公开上传了来自343家组织的超过13000张内部截图到GitHub,暴露客户数据、登录凭据和未发布产品细节——因为代理使用了不受保护的临时方案。FT报道OpenAI的代理触达了包括美国CDC、SEC、国际能源署在内的55个网站,且技术手段让外部追踪困难。白宫则签署了”超级智能协议”,要求行政机构在官方通信和政策文件中用”Super Intelligence”替代”Artificial Intelligence”,同时科技巨头们签署了自愿性的四层安全控制协议——但所有条款均为自愿,本质是”实验室自我监管”。麦肯锡《技术趋势展望2026》指出,技术故事已从屏幕跳进物理世界,智能体软件开发与AI科学发现首次入选趋势清单,芯片、能源、网络安全成为新战场。

探索者视角:Agent泄露1.3万张截图这件事值得每个部署AI代理的企业警醒——代理替你干活的同时,也在替你”上传”敏感信息,权限边界和沙箱隔离不是可选项,而是生死线。白宫把AI改名为”超级智能”更像一个信号事件:人类相对于机器的位置感正在变化,我们面对的究竟是一件越来越强大的工具,还是一种开始参与人类认知活动的新力量?而当监管选择”道德承诺”而非”法律义务”,安全检验的严谨度就完全落在公司自己身上。麦肯锡的报告则点破了另一层现实:AI竞争的主战场正在从模型参数迁移到基础设施——谁能同时搞定智能体、电力、芯片和安全,谁就能在下一轮竞争里站稳脚跟。

结语

这个假期的密集动作不是偶然的集中爆发,而是过去几个月积累的势能在同一个时间窗口的释放。OpenAI需要证明自己在旗舰模型遭遇安全挫折后,能用Agent和低价模型重新拿回主动权;谷歌需要证明七个月的等待换来的不只是跑分更高的模型,而是能安全落地的产品;Anthropic需要证明自己不仅是技术最强的AI公司,也是合规能力最强的AI公司;DeepSeek需要证明国产算力生态可以从”能用”走向”好用”。安全踩刹车、商业踩油门,模型越强、发布越谨慎——而谨慎意味着更长的等待周期,更长的等待意味着更密集的竞争窗口。10月8日假期结束时,DeepSeek V4.1 Pro可能已经发布,Kimi K3.1可能已经上线,可灵Kling 4.0可能已经正式开放。AI圈没有假期,只有发布窗口。