1. Google 发布新一代前沿模型 Gemini 4 Argon,目前仅通过 Fairwind Program 向受信任的网络安全防御者开放,后续计划逐步扩展至开发者、企业和消费者,并从付费 API 客户及 Google AI Ultra 用户开始。Argon 面向软件工程、金融、法律等企业知识工作及网络安全等复杂长流程任务,单次输出上限提升至 100 万 token。Google 已让数千名员工在内部将其用于编码、研究和写作,并用于大规模代码迁移、数据中心内存优化等任务。首发价为每百万输入/输出 token 2/10 美元,缓存输入低 95%;首发期后价格将调整为 4/20 美元。Google 同时加强了滥用防护、提示注入防御、失配监控和沙箱隔离。
2. 哔哩哔哩 Index LLM 团队发布 Index-Translate 多语言翻译模型系列,文本模型覆盖 150 种语言,提供多种尺寸,支持术语、风格、格式等翻译指令。同时推出面向长文档的 Index-NativeLong、音节可控翻译 Index-Homura,以及字幕和语音配音模型 Index-Echo。模型权重、代码、Demo 和技术报告已逐步开放,采用 Apache-2.0 许可证。
3. 蚂蚁百灵推出 Ling-3.1-flash 模型,面向办公、医疗和软件研发等长流程任务,并开放为期两周的免费体验,免费期间服务长度为 256K,体验期结束后将开源。
4. MiniMax 推出 M Plan 订阅方案,分为 Go、Explore 和 Build 三档,承接并拓展 Token Plan 的订阅能力,套餐订阅价格与文本使用额度保持不变,Explore 和 Build 还可使用 H3 视频模型。Token Plan 已停止新购,已订阅且开启自动续费的用户现有套餐保持不变;升级到 M Plan 后历史优惠和额外权益(如 ∞ 限额、150% 周额度)不再保留。同步开启月付首月 5 折活动,持续至 10 月 14 日;Go、Explore、Build 的月费原价分别为 49 元、119 元和 469 元。
5. OpenRouter 更新 Space Bunny Alpha 测试进展,已推出速度和可靠性改进,免费匿名测试期延长至 10 月 5 日。
6. Anthropic 宣布上线面向开发者的新站点 Claude.dev,提供工程深度文章、Claude Code 与 API 使用指南,以及 Claude 团队的工程经验分享。
7. Pi 发布 v0.99.0 版本,加入此前公开拒绝的 MCP 支持,团队称如今的 MCP 已与过去不同,升级后即可连接 MCP 服务器并使用新的 codemode 编排工具调用。
8. Grok Bot 更新了软件开发能力,可将编码任务交给 Cursor,借助 GitHub 与 Origin 插件管理 PR,并可分享构建成果的视频演示。
9. Ollama 新增对决策模型类别的本地支持,Nimble、Tev1 4b 和 Tev1 0.8b 三款决策模型已上架,可通过新增的本地 systemone 接口调用。
10. 腾讯混元官方宣布,WorkBuddy 上的 Hy3 模型限免和 Hy4 preview 夜间限免均延期至 10 月 31 日。
11. ChatGPT Sites 现已支持托管 MCP 服务器及插件扩展,用户在 ChatGPT 中描述想做的工具,系统会自动创建 MCP 服务器并部署到 Sites,还能再转为插件安装到网页、手机和桌面端。
12. Google 在 Gemini 中上线 skills 功能,用户可将重复任务的指令保存为技能反复使用,已面向全球个人用户推出。官方称 skills 将取代 Gems,个人账户自 11 月起生效,现有 Gems 会自动迁移为 skills。
13. 豆包上线出行服务,在对话框中一句话即可预订机票和火车票,并能叫车与导航,该功能已开放体验。
14. SeerRay-Lab 团队开源 0.8B 的 OCR 模型 Xiaomi-OCR-0,可将文档图像解析为 Markdown 与 JSON,模型权重、代码与线上 Demo 均已开放。
15. Perplexity 联合 turbopuffer 发布 9B 上下文嵌入模型 pplx-embed-v2-context-9b-preview 及检索基准 context-bench,模型权重已开放,API 服务准备中。
16. Cohere 发布 Embed 5 系列 embedding 模型,分为 Pro 和 Fast 两个版本,官方称 Pro 在 ViDoRe V3 基准上取得最高平均分,Fast 成本比 Pro 低三分之一。
17. HeyGen 发布首个通用视频模型 HeyGen Video,基于 MiniMax H3 后训练,支持文生视频、图生视频与参考图生视频,每段视频声音在同一次调用中生成。
18. Ideogram 发布图像编辑模型 Ideogram 4.5,已在 Ideogram 平台与 API 上线,官方称其减少了多轮编辑中的画面漂移,并支持高分辨率图片编辑。
19. Inception 在 OpenRouter 上线决策模型 Mercury Decide,免费开放早期访问,官方称其为 OpenRouter 上最智能的决策模型。Inception 还发布了面向语音 Agent 的 diffusion LLM Mercury Voice,已面向企业客户开放,首个回答 token 中位延迟低于 320 毫秒,发布期间 API 价格五折。
20. DeepSeek 开源面向华为昇腾算力平台的基础设施组件,包括 TileLang 高级语言编译工具、计算库与分布式通信库,与此前面向英伟达平台的开源组件一一对应,官方称其计算与通信性能已接近硬件上限。
21. Anthropic 发布机器人暴露指数研究报告,使用 Claude 评估当前机器人可完成的工作任务,结果显示机器人可完成 74% 的美国体力任务,但成本低于人力的任务仅占 0.3%。
22. Google DeepMind 发布 SynthID Bio,将 SynthID 水印技术扩展到合成生物学,可在保持蛋白质生物学功能的前提下为 AI 设计的蛋白质嵌入可验证水印。方法论文已在 Nature 发表,代码与体外实验数据开源,模型权重也将向研究社区发布。
23. Artificial Analysis 开源本地推理测试工具 AA-AgentPerf-Local,可重放真实 Agent 会话以测试笔记本和工作站跑本地模型的速度,工具与配套榜单已上线。
24. 评测机构 Artificial Analysis 发布文生视频基准 AA-Video-T2V v2.0,基于 1080p 画质与超过 6.8 万份人类偏好投票对模型进行排名,榜单显示 Wan 3.0 综合排名第一。
25. 腾讯混元联合复旦大学、清华大学发布 ExplorationBench 基准,用于评测 AI 系统能否在完全陌生的规则中自主探索出新知识。
26. OpenAI 与 Synopsys 签署多年期战略合作协议,共同开发面向芯片设计的专用模型 GPT-Synopsys,该模型由 OpenAI 托管运行并可直接操作 Synopsys 的 EDA 工具。
27. OpenAI 发文称已挫败一起有组织提取其模型受保护推理内容的行动,攻击者并未破解加密或入侵数据库,而是通过操纵模型交互使推理内容对请求者可见。
28. 据报道,美国联邦贸易委员会(FTC)正在调查 OpenAI、Anthropic 等头部 AI 实验室,评测机构 METR 也在调查范围内。一名 FTC 官员证实,机构将在未来几周内发出民事调查要求,强制相关公司提交文件并接受高管问询。
29. 智谱工作人员表示,GLM-5.3 通过 OpenVuln 守护 389 个开源项目,累计发现 4249 个潜在漏洞,OpenVuln 扫描服务目前仍在运行并保持免费。
30. 据报道,Google 正向约 100 家数字出版商付费,将其内容用于 AI Overviews 等 AI 功能;付费金额差异较大,部分参与者表示不清楚 Google 如何计算相关费用。
31. ElevenLabs 宣布完成 3 亿美元员工股份要约收购,公司估值达到 220 亿美元,约为今年 2 月 Series D 融资估值的两倍。
32. 据报道,豆包的个人智能助理产品名为「小豆」,计划推出独立 App,目前仍在内部测试,豆包方面对相关消息暂无回应。
33. 据《纽约时报》报道,Anthropic 联合创始人 Christopher Olah 在此前数月邀请数十位宗教和哲学学者举行保密会谈,讨论 Claude 的道德塑造与 AI 意识问题。