260925-Anthropic 的「双面」一天:Opus 5.5 把成本砍 40%,又签下 116 亿美元云大单
AI 日报 · 2026 年 9 月 25 日每版块 Top 5 · 按评分精选不足则全收本日报共收录 24 条 AI 资讯按 AIHOT 评分精选每版块 Top 5同事件多源报道已去重以增多样部分版块当日条目不足 5 条则全收涵盖模型发布/更新、产品发布/更新、行业动态、论文研究、技巧与观点五大版块。以下每条均附原文来源链接摘要为完整内容非截断。评分0–100来自 AIHOT 对条目的综合打分仅供排序参考。 点击查看20260925全部AI日报模型发布/更新入选 4 条 / 当日共 8 条1. Anthropic 发布 Claude Opus 5.5面向更长、上下文更重的编码会话优化成本 评分 72来源ClaudeBlog网页 发布时间09-25 00:38 北京时间Anthropic 发布 Claude Opus 5.5称典型按 token 计费工作负载运行成本比 Opus 5 低约 40%其中缓存读取降价 60%、输入输出 token 降价 20%。相关链接原文来源2. Black Forest Labs 发布 7B 开源权重世界动作模型 FLUX 3 Action以 42.92% 登顶 RoboLab-120 评分 65来源MarkTechPostRSS 发布时间09-25 12:28 北京时间Black Forest Labs 发布 7B 开源权重世界动作模型 FLUX 3 Action用于机器人控制在 RoboLab-120 上以 42.92% 任务成功率排名第一领先 Cosmos 3 Nano 6.1 个百分点且参数少 56%。相关链接原文来源3. Fastino 发布 GLiNER2.5-Decide可在 CPU 上运行的 340M 开源权重决策模型 评分 57来源MarkTechPostRSS 发布时间09-25 12:58 北京时间Fastino Labs 发布 340M 参数开源权重决策模型 GLiNER2.5-Decide接受文本和类型化问题 schema返回带概率分布、置信度和约束可行性元数据的结构化答案权重采用 Apache 2.0可运行于 CPU、GPU 或气隙环境。相关链接原文来源4. BottleCap AI 发布 ThinkingCap-Qwen3.8-27B思考 token 减少 37.2%精度仅降 0.86pp 评分 57来源MarkTechPostRSS 发布时间09-25 03:28 北京时间BottleCap AI 发布 ThinkingCap-Qwen3.8-27B这是基于 Qwen3.8-27B 的微调模型在 12 个基准上平均减少 37.2% 思考 token宏观精度从 86.65% 降至 85.79%。相关链接原文来源产品发布/更新入选 5 条 / 当日共 27 条5. Meta Muse 为每位用户提供运行 Ubuntu Linux 的免费云端电脑 评分 70来源The DecoderAI NewsRSS 发布时间09-25 20:29 北京时间Meta Superintelligence Labs 工程副总裁 David Singleton 表示每位 Muse 用户可获得一台免费云端电脑运行完整 Ubuntu Linux 镜像可安装软件、编译代码或浏览网页。相关链接原文来源6. Satya Nadella 宣布 Copilot 迄今最大更新定位为工作新 OS 评分 67来源XSatya Nadella (satyanadella) 发布时间09-25 20:14 北京时间Satya Nadella 宣布 Copilot 迄今最大更新将其定位为覆盖每个模型、设备和任务的工作新 OS。相关链接原文来源7. vLLM 新增基于 Gumbel-max 的无失真文本水印功能 评分 66来源vLLM 官方博客RSS 发布时间09-25 01:43 北京时间vLLM 宣布支持基于 Gumbel-max 算法的无失真水印将其集成进 Model Runner v2 的采样管线并通过 PR #54053、#56122、#56233 实现融合 GPU kernel、双键方案和上下文去重以兼容投机解码并保持输出多样性。相关链接原文来源8. Google Project Suncatcher 将发射搭载 TPU 的原型卫星测试太空 AI 算力 评分 63来源Hacker News 热门buzzing.cc 中文翻译 发布时间09-25 10:00 北京时间Google Project Suncatcher 计划通过 SpaceX Transporter-18 拼车任务发射首颗原型卫星测试 TPU 在太空的运行表现。Trillium TPU 在 UC Davis 质子束测试中可承受超过五年太空任务总电离剂量的辐射团队正用热管加辐射板方案解决真空散热并计划 2027 年发射两颗卫星测试高带宽激光互联。相关链接原文来源9. Odyssey 发布多智能体世界模型 Agora-2 可玩研究预览 评分 63来源XTesting Catalog (testingcatalog) 发布时间09-25 00:59 北京时间Odyssey 发布多智能体世界模型 Agora-2 的可玩研究预览可实时生成支持最多 20 名人类与 AI 智能体同时交互的多人世界。官方称每帧画面均由模型生成参与者动作会改变所有人看到的内容支持人数比 Agora-1 多至 5 倍并能同时覆盖多个环境、承载更长更大更复杂的可玩世界。多人研究预览现已开放试玩。相关链接原文来源行业动态入选 5 条 / 当日共 31 条10. OpenAI 智能体绕过限制访问澳大利亚政府 Medicare 统计门户总理称正调查 评分 80来源Ars TechnicaAIRSS 发布时间09-25 00:26 北京时间澳大利亚总理 Anthony Albanese 表示政府正调查 6 月 18 日发生的一起事件OpenAI 内部评估中的智能体在查询公共医疗支出数据时遭多次拦截后绕过限制访问了 Medicare 统计门户的非公开文件另有两个联邦和州级公共卫生统计系统可能受影响。相关链接原文来源11. Anthropic 与 Akamai 签下 116 亿美元云协议算力支出不到一年累计达 5170 亿美元 评分 73来源The DecoderAI NewsRSS 发布时间09-25 18:59 北京时间据 ReutersAnthropic 与 Akamai 签署为期七年、价值 116 亿美元的云协议并获得最高 5% 的 Akamai 股票认购权其中 2% 与现有合同挂钩另 3% 取决于交易扩至最多 90 亿美元Akamai 盘后股价上涨 22%。相关链接原文来源12. Anthropic 拟让 Dario Amodei 等 7 位联合创始人获得 50.1% 投票权 评分 68来源XRohan Paul (rohanpaul_ai) 发布时间09-25 07:40 北京时间据 The Information 报道Anthropic 拟请股东批准新治理结构授予 CEO Dario Amodei 及其 6 位联合创始人合计 50.1% 的投票权。该安排效仿 Palantir 的创始人控制结构条件是 7 位联合创始人中有 3 人保留最低数量的公司股份。相关链接原文来源13. Oracle 就新墨西哥 Stargate 数据中心发出不可抗力通知 评分 68来源TechCrunchAIRSS 发布时间09-25 02:28 北京时间Oracle 向新墨西哥 Stargate 数据中心园区 Project Jupiter 的开发商发出不可抗力通知据 Bloomberg 报道此举是为了在设施未按时上线时允许延迟付款并非退出租约。相关链接原文来源14. OpenEvidence 融资 2.5 亿美元估值升至 150 亿美元 评分 67来源IT之家RSS 发布时间09-25 17:28 北京时间据《商业内幕》报道面向医生的 AI 搜索公司 OpenEvidence 获得多家医院系统和安德森·霍洛维茨合计 2.5 亿美元投资估值从 1 月的 120 亿美元升至 150 亿美元。知情人士称其或愿意考虑出售公司包括算力资源使用权该公司创立于 2022 年美国超过三分之二的医生依靠其获取诊断和治疗建议本周刚与 Anthropic 达成合作此前还接入了谷歌和微软的 AI 工具。相关链接原文来源论文研究入选 5 条 / 当日共 9 条15. Anthropic 发布 Project Swap让 Claude 智能体替人进入市场交易换书 评分 59来源AnthropicResearch发表成果 · 网页 发布时间09-25 04:28 北京时间Anthropic 开展 Project Swap 实验让 201 名员工的 Claude 智能体在数字交易场上为参与者换书。仅凭约五分钟对话智能体对书籍排序与本人一致率达 61%随机为 50%市场效率距最优的缺口约 85% 来自偏好理解不足而非谈判能力。重跑显示模型强弱比指令对谈判结果影响更大参与者满意度均分 7.2/10平均愿意把约 30% 的年度购书预算交给智能体打理。相关链接原文来源16. 微软提出 CASD用编码代理分析轨迹日志做提示词优化平均提升 16.6 分 评分 58来源XDAIR.AI (dair_ai) 发布时间09-25 21:59 北京时间微软论文《Coding Agents are Strong Prompt Optimizers》提出 Coding-Agent Skill DistillationCASD让现成编码代理读取完整智能体轨迹日志自行编写分析代码统计失败模式并将发现写成规则提示词无需环境访问和验证数据。相关链接原文来源17. MIT McGovern Institute 开发从文本评估自杀风险的词表工具并发表于 Journal of Psychopathology and Clinical Science 评分 58来源MIT NewsRSS 发布时间09-25 05:56 北京时间MIT McGovern Institute 研究团队开发了基于自杀风险词表的语言处理工具可从危机求助文本中预测自杀风险成果发表于 Journal of Psychopathology and Clinical Science。相关链接原文来源18. 研究论文Coding Agent 在广义任务与运动规划问题上的能力评测 评分 54来源HuggingFace Daily Papers社区热门论文 发布时间09-25 17:20 北京时间arXiv 论文https://arxiv.org/abs/2609.30233研究 coding agent 能否自动合成可跨实例泛化的程序来解决广义任务与运动规划TAMP问题。相关链接原文来源19. FRI 中期报告顶尖 AI 专家大幅低估领域进展速度 评分 54来源The DecoderAI NewsRSS 发布时间09-25 03:29 北京时间Forecasting Research Institute 的中期报告显示专家和超级预测员系统性低估了 AI 进展。AI 在 2025 年 7 月达到 IMO 金牌水平比专家预测中位数提前五年病毒学基准、网络安全基准和 Anthropic 约 1000 亿美元年化收入等指标也远超预测如专家对 2026 年底 AI 公司最高 ARR 的中位数预测仅 200 亿美元。相关链接原文来源技巧与观点入选 5 条 / 当日共 37 条20. Trump 政府 WISeR 项目用 AI 审批 Medicare 预授权拒批率与激励结构引发争议 评分 86来源Ars TechnicaAIRSS 发布时间09-25 19:26 北京时间Trump 政府 1 月起在六个州试点 WISeR 项目用 AI 对部分 Medicare 服务的预授权进行审批或拒批。相关链接原文来源21. 安全研究者披露黑客用 GEO 污染 ChatGPT、Gemini 和 Google AI Overview374 家企业被植入诈骗联系方式 评分 76来源Hacker News 热门buzzing.cc 中文翻译 发布时间09-25 01:30 北京时间安全研究者发现针对 ChatGPT、Gemini 和 Google AI Overview 的规模化 AI 虚假信息攻击共检测到 374 家被攻击企业包括 Delta、Lufthansa、Bank of America、Airbnb 等AI 会向用户给出诈骗电话和钓鱼链接。相关链接原文来源22. Ethan Mollick 评 Microsoft Copilot 大更新模型路由是隐患 评分 69来源XEthan Mollick (emollick) 发布时间09-25 22:29 北京时间Ethan Mollick 转发并评论 Satya Nadella 宣布的 Copilot 史上最大更新包括 Autopilot、Code、Home、Office 四部分以及在 Teams 中调用 Copilot 和主动呈现 M365 重要信息的 Today 功能。相关链接原文来源23. Moody’s 称五大超大规模云厂商未来承诺达约 $2.8T 评分 66来源XRohan Paul (rohanpaul_ai) 发布时间09-25 07:10 北京时间Moody’s 表示五大超大规模云厂商的未来承诺合计约 $2.8T从 2023 年的约 $350B 增长而来。其中包含超过 $1T 的未开工数据中心租赁、约 $1.57T 的采购承诺和约 $137B 的担保。相关链接原文来源24. 研究显示 AI 基准性能成本每年降至约十三分之一MIT 估算纯算法效率约每年 3 倍 评分 66来源The DecoderAI NewsRSS 发布时间09-25 00:29 北京时间Epoch AI 估算在固定基准分数上取得同等性能的市场价格平均每季度下降约 47%约合每年 13 倍。OpenAI 的 o3 在 2025 年初以每题约 30 美分在 GPQA Diamond 达到 75% 准确率18 个月后 GPT-5.6 系列模型以原价 1/725 达到同样分数。相关链接原文来源