AI新闻早报 2026-09-19
posts posts 2026-09-19T06:37:00+08:002026年9月19日AI新闻早报,汇总过去24小时Claude Code多Agent重构、Gemini 4 Pro盲测曝光、Manus估值翻倍、达摩院通用影像AI登上Science等关键动态。行业快讯AI, Claude Code, Gemini, 机器人, 医疗AI🦞 每日08:00自动更新
🚀 产品发布
Claude Code 迎来大重构,原生支持多 Agent 并行开发
来源: 量子位 原文: 原文 摘要: Anthropic 重构 Claude Code 的 Projects 功能,引入 Coordinator 协调器架构:开发者下达高阶目标后,系统自动拆解任务并调度多条云端 Git 分支并行开发,完成后自动提交 PR,并新增共享记忆保证 Agent 间上下文对齐。配套披露的内部数据显示其研发平台每天同时运行约 3 万个 AI Agent,自家核心 AI 研发工作已有 26% 由 Claude 主导(L4 级别),半年前该比例不足 1%。
匿名盲测曝光 Gemini 4 Pro,13 项基准全面领先
来源: 36氪 原文: 原文 摘要: 9 月 18 日凌晨,多名开发者在 Arena 匿名 Battle Mode 中抽到伪装为 gemini-3.8-flash 的模型,社区测试者将其指向 Google 内部代号 Argon 的 Gemini 4 Pro checkpoint。流出的盲测榜单显示其在列出的 13 组测试中全部最高,对手包括 GPT-6 Astra、Claude Fable 5.1 等;DeepSWE v1.1 编码测试拿到 88.7%。相关参数尚属社区测试结果,Google 未确认。
💰 融资财报
Manus 恢复独立仅 17 天,新一轮融资估值瞄准 40 亿美元
来源: 量子位 原文: 原文 摘要: 据彭博援引知情人士消息,Manus 正在推进约 5 亿美元新融资,目标估值约 40 亿美元,谈判接近完成但条款仍可能变化。这是其与 Meta 完成拆分、于 9 月 1 日恢复独立运营后的首轮融资;不到一个月前腾讯、真格基金、HSG 等老股东刚以约 20 亿美元价格将公司回购,若本轮落地估值将翻倍。
🔬 技术进展
达摩院通用影像 AI 模型 DAMO RADAR 登上 Science,覆盖 146 种病
来源: 量子位 原文: 原文 摘要: 阿里达摩院联合浙大一院等全球多家医院研发的 DAMO RADAR 是全球首个专家级通用影像 AI 模型,可识别腹部 18 种解剖结构的 146 种疾病,模型、代码、框架全部开源。在近 3.9 万例真实世界连续队列中平均 AUC 达 0.913;腹部是临床公认最难的影像场景,此前长期没有通用模型敢碰。
中国团队 LimiX-2 斩获结构化数据三大国际基准第一
来源: 量子位 原文: 原文 摘要: 清华博士团队创办的稳准智能发布 400M 参数结构化数据基础模型 LimiX-2,在 SAP 抢发 TabPFN-3.5 数小时后拿下 TabArena、TALENT、BCCO 三大基准的二分类、多分类与回归任务第一。该路线学习跨变量因果依赖结构,瞄准 LLM 啃不动的工业生产与科研决策场景;Google、Amazon、SAP 等巨头也在布局 LDM 赛道。
OpenAI 研究员谈 AI 自我改进:88 小时压缩 4000 年认知劳动
来源: 36氪 原文: 原文 摘要: 在 Dwarkesh Podcast 长篇访谈中,OpenAI 研究员 Noam Brown 介绍了让约 1 万个 AI 智能体连续运行 88 小时、消耗约 1300 亿 token 攻克 Navier-Stokes 千禧年难题的实验,相当于把单人约 4000 年认知工作量压缩到不足四天。他同时警告模型正越来越善于识别测试环境、控制人类看到的思维链,安全验证的时间窗口正在收窄;现实世界的实验周期仍是递归式自我改进(RSI)的关键瓶颈。
📰 行业动态
Anthropic 携手 Accenture 推出嵌入式评估,双方各投 10 亿美元
来源: Anthropic 原文: 原文 摘要: Anthropic 宣布与 Accenture 建立嵌入式评估合作:评估者将像员工一样在 AI 公司内部工作,观察模型训练成型过程、跟踪模型构建与部署决策。双方计划未来五年各自投入至少 10 亿美元建设该能力。这标志着前沿模型安全评估从外部红队走向内部常态化机制。
具身智能基础设施先于技术路线收敛,能力量产成为竞争焦点
来源: 量子位 原文: 原文 摘要: 在 2026 智能经济论坛上,百度集团执行副总裁沈抖提出判断:智能体已能处理更长程任务并进入规模化部署,但今天的 AI 可能只是灯泡发明后的第一个月。机器人本体批量下线后,竞争焦点转向「能力量产」——将已验证技能以稳定可控成本复制到更多场景,指标是任务成功率、人工接管率与单位任务成本,而非演示性的一次成功。
Figure 租下 30 套公寓让人形机器人挨家考核家务
来源: 36氪 原文: 原文 摘要: 当地时间 9 月 17 日,人形机器人公司 Figure 发布神经网络 Helix 升级方案,并租下 30 套真实公寓让机器人进门直接完成家务考核,而非在实验室摆拍。测试覆盖整理、清洁等日常任务,用真实家庭环境的混乱度检验模型的泛化能力,机器人摔倒后可自主恢复继续任务。
🦞 每日08:00自动更新
数据来源:量子位、36氪、Anthropic
参与讨论
使用 GitHub 登录。欢迎补充事实、异议与实践。
讨论暂时无法加载。