🤖 AI 新闻日报 – 2026年09月20日
2026年09月20日 · 自动生成
谷歌 Gemini 4 Pro 现身 Arena 盲测,13 项跑分领跑
距 Gemini 3.1 Pro 发布七个月后,谷歌跳过小版本迭代,将旗舰 Gemini 4 直接投入测试。多名开发者在 Arena 匿名对战模式中抽到内部代号”Argon”的测试点,社区盲测榜单显示其在 13 项基准上领先 GPT-6 Astra 与 Claude Fable,价格仅约五分之一,超长上下文测试中可稳定输出至接近 256K 规模。
谷歌 ScientistTwo:AI 研究实现递归自我改进
谷歌发布 ScientistTwo 论文,展示 AI 研究助手的闭环自我改进:先提出想法、测试并淘汰无效方案,再以自身改进结果为新基线继续迭代。在基于 ICLR、ICML 和 NeurIPS 论文构建的 107 个机器学习问题中,它自主改进了 86 个,成功率 80.4%,相对人类基线平均提升 25.2%。论文同时划出边界:实验可以自动化,科学判断仍归人类。
“只会做判断”的模型 Jev 亮相,专攻企业决策
旧金山初创 TypeSafe AI 推出决策专用模型 Jev:不生成文本、不能聊天,只以结构化输出做分类、路由与评分,一次调用可并行回答多个问题,端到端延迟多数约 100 毫秒,成本较多次调用大模型低约 12 倍。创始人为 OpenAI 前研究员、InstructGPT 主要作者 Diogo Almeida,主打概率校准,定位智能体架构中的高频判断层。
Kimi K3 登陆亚马逊 Bedrock,与 GPT-6 Astra、Claude Fable 5.1 同台
月之暗面 Kimi K3 正式在亚马逊 Bedrock 全面开放,作为开放权重选项面向编码与知识工作场景:总参数 2.8 万亿、原生视觉、100 万 token 上下文,并支持显式提示缓存。AWS 同步接入 OpenAI GPT-6 Astra 与 Anthropic Claude Fable 5.1,头部闭源与开源模型同台竞技,中国大模型的海外企业级分发渠道进一步拓宽。
豆包端侧智能体手机开售,首销一秒破亿
搭载豆包手机助手、号称全球首款量产 AI 智能体手机的努比亚 NaviX Ultra 于 9 月 16 日正式发售,首销一秒破亿。该机将跨 App 操作升级为端侧 MCP 架构,通过端侧 Agent 与视觉感知模块直接接管应用操作,目前生态优先覆盖字节系产品,支付类应用尚未打通,AI 硬件入口竞争正式延伸至整机层。
国产大模型商业化分化:海外收入成为分水岭
大模型厂商商业化进入兑现期:月之暗面 Kimi 系列接入 AWS Bedrock 与微软 Azure 后,截至 6 月海外付费用户同比增长 400%,覆盖 180 多个国家和地区,ARR 突破 3 亿美元;MiniMax 拿下中国大模型首个国家级技术底座订单,上半年海外收入 7083 万美元、占比 60.8%,国产模型正从卖 API 升级为输出底层技术方案。
从呼吁减速到考虑加速,Anthropic 仅用六天
9 月 12 日 Anthropic CEO Dario Amodei 发表 3800 字长文警告前沿 AI 风险,呼吁”放缓提升模型能力的速度”,Altman 与马斯克罕见公开附和;仅六天后,路透社报道 Anthropic 正考虑打乱既定发布节奏、提前推出新模型。安全叙事与商业竞争的张力在这轮竞赛中暴露无遗,行业自律面临现实考验。
黄仁勋预测:英伟达 2027 年营收冲刺 6730 亿美元
英伟达 CEO 黄仁勋预测公司 2027 年营收同比增长 70%、芯片销量翻倍,年化营收瞄准约 6730 亿美元,主权 AI 需求是核心驱动。他同时就近期 AI 安全事件表态”没准备好就先压住”,并宣布与谷歌、Emerald AI 共建 AI 能源管理联盟,把算力扩张背后的电力约束首次摆上合作议程。
十万卡时代:9 月旗舰密集发布,Scaling Law 仍未失效
9 月国内外厂商集中发布新一代旗舰:Anthropic Claude Fable 5.1、OpenAI GPT-6 Astra(超 10 万块 GPU 训练)、DeepSeek V4.1-Flash、xAI Grok 4.7 接连登场。分析指出 Scaling Law 尚未打破,但同等幅度能力提升所需成本呈指数级上涨,头部厂商间”融资+迭代”双线狂奔成为行业生存法则。
TypeSafe AI 获 4000 万美元种子轮,押注”决策模型”赛道
隐身两年的 TypeSafe AI 完成 4000 万美元种子轮融资,DCVC 领投,估值约 2 亿美元。创始人、InstructGPT 主要作者 Diogo Almeida 主张把智能体中大量高频路由、分类、校验判断从生成式大模型剥离,交给结构化决策模型处理;当单次判断成本降至一美分以下,软件可能在从未想过的地方塞满决策。
AWS:AI 业务年化收入超 250 亿美元,资本开支上调至 2200 亿美元
亚马逊披露其 AI 服务业务年化收入运行率已突破 250 亿美元,并将 2026 年资本开支上调至 2200 亿美元,继续加码 AI 基础设施。同日 AWS 确认巴林区域因伊朗无人机袭击后数据无法恢复,成为已知首例战争物理摧毁云区域事件,云容灾与地缘风险开始进入投资者视野。
Meta 自研芯片 Iris 量产,算力目标一年半翻倍
Meta 第四代自研加速器 Iris 进入量产,支持公司到 2027 年底将算力从 7GW 翻倍至 14GW 的目标。扎克伯格同日公开反对行业集体”减速”,认为市场竞争与法律责任已构成足够的安全激励,并透露 Meta 曾为加固安全将个人智能体 Muse 延迟数月上线,自研芯片正成为其算力战略的支柱。
Mistral 与道达尔达成超 1 亿欧元油气 AI 合作
法国 Mistral AI 宣布与能源巨头道达尔达成三年、金额超 1 亿欧元(约 1.15 亿美元)的合作,双方将共建联合科学实验室,为油气勘探、油藏表征与油田开发训练专有前沿模型。此前 Mistral 刚完成三星领投的 30 亿欧元 D 轮融资,估值超 210 亿欧元,垂直行业大单成为欧洲 AI 商业化样板。
微软紧急修补 Azure AI Foundry 最高级安全漏洞
微软针对 Azure 与 Copilot 的 18 个漏洞完成服务端修复,其中 Azure AI Foundry 存在最高级 CVSS 10.0 漏洞(CVE-2026-85889),可实现未经身份验证的权限提升;Azure 计费与 Microsoft Fabric 也受 10.0 级问题影响。修复无需用户操作,但安全社区提醒企业重点监控特权身份与异常调用。
