1. Google 发布 Gemini 3.8 Flash 及安全防御版 Gemini 3.8 Flash Cyber。3.8 Flash 在保持 3.7 Flash 相同速度与首发价格的同时,强化软件工程、智能体和多步推理能力,复杂任务会增加推理与工具调用,因此可能消耗更多 Token,已接入 Gemini API、AI Studio、Antigravity 等平台。Cyber 版聚焦漏洞发现与修复,仅通过 Fairwind Program 向可信防御机构开放。
2. Meta 发布 Muse Spark 1.3,已在 Muse Code 和 Meta Model API 上线,Agentic 与编码表现提升,并预告后续将推出更大模型以及 Muse Spark 开放权重版本。
3. 通义千问(Qwen)发布 Qwen3.8-Max-0902 模型,经专业办公与编程后训练,Agent 编程能力大增,已上线 API 与相关应用。
4. Anthropic 为 Claude Cowork 和 Claude Code 推出后台 computer use 功能,Claude 可在后台操作而无需接管鼠标,目前仅限 macOS 15 及以上系统的 Pro 与 Max 用户。
5. Anthropic 开源 Claude Commerce Agents,为企业提供购物 Agent 与商家 Agent 的参考实现,并配套 Claude Code 插件及零售、旅行、电信等场景示例。
6. Perplexity 开源为 Perplexity Computer 混合计算打造的本地推理引擎 Lily,专为 Apple Silicon 上运行 Qwen3.6-35B-A3B 优化,现已在 GitHub 公开。
7. 西班牙公司 Multiverse Computing 推出 4380 亿参数推理模型 Quasar 438B,官方称其为 Artificial Analysis 评测中最强的欧洲模型,已开放 API。
8. fal 发布 MiniMax H3 Max Turbo 预览版,官方称速度翻倍、成本减半、质量约为原版 97%,促销价为期两周,已开放试用。
9. 豆包工作本周上新两项功能:多 Agents 并行,以及 Mac 系统下的操作电脑能力。
10. Anthropic 上线 Claude Content Checker,可检查文件是否带有 Claude 签发的 C2PA Content Credential,以判断 Claude 是否参与过文件的生成或处理,但文本水印无法通过该网页工具检查。Anthropic 同时提供 Detection API。
11. Proximal 团队发布 FrontierSWE v2 基准,包含 34 项超长时程任务,每项提供 20 小时预算。
12. 谷歌推出 Fairwind Program,向政府机构与可信赖伙伴有限开放其网络防御能力,首批提供 Gemini 3.8 Flash Cyber,用于自主查找和修复漏洞。
13. 报道称 Astra 采用「recurrent depth」推理方式,在改善成本与性能的同时,也引发模型内部推理更难监控的担忧。OpenAI 首席科学家 Jakub Pachocki 随后澄清,Astra 等前沿模型的实际计算深度最高仍在 GPT-4 的两倍范围内,并警告不要因误读报道而引发行业竞相牺牲思维链可监控性。
14. 美国司法部在《纽约时报》诉 OpenAI 版权案中提交法律文件,主张用版权文本训练大语言模型属于合理使用。该文件并非裁决,案件仍在法院审理中。
15. 智谱入驻天猫开设智谱旗舰店,上架 GLM Coding Plan 订阅套餐。
16. WorkBuddy 开放平台正式上线,面向智能硬件、行业应用与开发者开放底层 Agent 能力,首批引入超百家生态伙伴。
17. 有用户实测发现,OpenAI API 对模型标识 gpt-6-astra 返回 404 错误,而对不存在的模型名返回 400 错误,据此推测新模型已部署、即将发布。
18. 马斯克宣布 Grok 4.7 模型将于 10 天后推出,他此前透露该模型参数达 2.1 万亿,整体优于前代且有望超越竞品,但速度可能略慢。