NEWS / 01

资讯

按发布时间追踪 AI 模型、工具与公司的最新记录。

最新发布

GPT-6 Astra

OpenAI 发布 GPT-6 Astra:1.05M 上下文切入自主系统操控,攻防能力首触 Critical 红线

OpenAI 于 2026 年 9 月 3 日正式发布新一代旗舰模型 GPT-6 Astra。新模型标配 1,050,000(1.05M)Token 上下文窗口与 128,000(128K)Token 单次输出能力,研发重心转向端到端计算机操作与自主任务接管;在 ExploitBench 取得 100% 成绩,成为首个触发 Critical 网络安全风险等级的前沿系统,并引入了受限防御准入与阻断式对齐监控。

内容优先级98

Timeline

按发布时间继续阅读

  1. 02
    Claude Fable 5.1

    Anthropic 发布 Claude Fable 5.1:对标 GPT-5.6 Sol 登顶长程榜,缓存读取直降 75%

    Anthropic 于 2026 年 9 月 1 日推出主力旗舰 Claude Fable 5.1 及受限攻防孪生版 Mythos 5.1。在与前代 Fable 5 及 OpenAI 旗舰 GPT-5.6 Sol 的全面对标中,Fable 5.1 以 83.0 的 BenchLM 得分登顶榜首,并在长程科学终端评测中翻倍;同时将提示词缓存读取费率削减 75% 至每百万 0.25 美元,长程高频 Agent 的实际开销降低多达 45%。

  2. 03
    Gemini 3.8 Flash

    谷歌发布 Gemini 3.8 Flash:终端跑分首破 90%,主打长程编程与自主 Agent 容错

    谷歌推出 Gemini 3.8 Flash 与安全专版 3.8 Flash Cyber,主攻终端全流程操作与长程代码修复。新模型在保持 1M 上下文与低廉调用费用的同时,通过增加思考深度与多轮工具调用,在 Terminal-Bench 2.1 取得 90.8% 突破,并在 SWE-bench Pro 上达到 61.6%。

  3. 04
    阿里巴巴Qwen3.8-27B

    阿里云开源 Qwen3.8-27B:混合注意力架构与消费级单卡长程 Agent

    阿里云通义千问团队正式开源 27B 参数量稠密多模态模型 Qwen3.8-27B。新模型采用 48 层线性注意力与 16 层门控注意力的混合架构,内置 MTP 草稿头与可控思考模式,原生支持 262K 超长上下文并兼容消费级单卡本地部署,在 SWE-bench Pro 与 LiveCodeBench 等基准测试中大幅超越前代。

  4. 05
    GLM-5.3

    智谱发布 GLM-5.3:强化后训练强化学习与网络安全能力,两周内开源权重

    智谱 AI 正式发布基于 743B 基础模型深度后训练的新一代旗舰模型 GLM-5.3。借助 IndexShare、SAO 强化学习算法与 Slime 异步训练框架,该模型在 CyberGym 漏洞挖掘(84.5%)、AutomationBench(48.2%)与 GDPval-AA v2(1769)多项榜单取得第一,并在 Terminal Bench 3.0 达到 28.3 分,官方计划于两周内开源模型权重。

  5. 06
    DeepSeek Harness深度求索

    DeepSeek 开源模块化 Agent 框架 DeepSeek Harness

    DeepSeek 正式开源模块化智能体框架 DeepSeek Harness(dsh)。该项目基于 Cordis 元框架构建,采用全插件化架构解耦模型接入、执行循环与工具系统,并提供终端与本地 Web 界面,旨在为开发者提供高可扩展且支持全量审计的开源 Agent 开发与装配环境。

  6. 07
    Gemini 3.7 Flash

    谷歌发布 Gemini 3.7 Flash:主打长程编程与 Agent 工作流,首发 API 降价 50%

    谷歌正式发布 Gemini 3.7 Flash,主打长程代码编写与 Agent 工作流执行。模型具备 100 万 Token 上下文窗口与分级思考能力,在 DeepSWE 与 FrontierCode 等工程基准测试中较 3.6 Flash 明显提升,并在 2026 年底前提供 50% 的 API 调用折扣。

  7. 08
    深度求索

    DeepSeek V4-Pro 正式版上线:全面超过 Preview,API 调用方式不变

    DeepSeek V4-Pro 正式版已经上线,版本号为 DeepSeek-V4-Pro-0813,现有 API 模型名和调用方式保持不变。DeepSeek 公布的评测显示,正式版在十项 Agent 相关评测上全部超过 Preview,并在 Cybergym、AutomationBench 等项目进入当前前沿模型的第一梯队;生产环境仍需结合内部任务复测。

  8. 09
    Qwen3.8-Max阿里巴巴

    阿里巴巴发布 Qwen3.8-Max 旗舰大模型

    阿里巴巴正式发布新一代旗舰大模型 Qwen3.8-Max。新模型采用 2.4 万亿参数的稀疏混合专家(MoE)架构,单次激活 950 亿参数,原生支持 100 万 Token 上下文与多模态输入。新模型重点强化了长程自主编程与复杂智能体任务执行能力,并在 Arena 综合评测与视觉榜单中位居前列。官方同时宣布将在次周正式开源模型权重。

  9. 10
    字节跳动Seedance 2.5

    字节跳动发布 Seedance 2.5 视频生成模型

    字节跳动正式发布新一代视频生成模型 Seedance 2.5。新模型在统一的多模态音视频联合生成架构基础上,将单次生成时长翻倍至 30 秒,支持最多 50 个多模态素材参考输入,并引入了基于时间戳的局部精准编辑与原生 4K 输出能力,推动 AI 视频生成从短片段生成走向可工业化交付的完整创作。

  10. 11
    DeepSeek-V4-Flash深度求索

    DeepSeek-V4-Flash 官方正式版 API 开启公测

    DeepSeek 宣布 DeepSeek-V4-Flash 官方正式版 API 开启公测,版本标识符为 DeepSeek-V4-Flash-0731。在保持 284B 总参数与 13B 激活参数的轻量 MoE 架构下,新版模型经过重新后训练,其 Agent 核心能力大幅提升,在 Terminal Bench 2.1 和 Toolathlon 等多项基准测试上已接近甚至超越早期 V4-Pro 预览版。

  11. 12

    camelAI 架构重构:剥离虚拟机与 Bash 终端,全量迁入 Cloudflare Durable Object

    camelAI CTO 详细拆解了将其 Coding Agent 彻底拔除 VM 架构的演进过程。通过将 Agent 搬入 Cloudflare Durable Object,利用 SQLite 与 R2 持久化文件系统,并改用 Code Mode + Dynamic Workers 在 JS 沙箱中通过显式 API 执行代码,实现了架构简化、延迟降低与运行成本的量级暴跌。

  12. 13
    OpenAI

    OpenAI 分析 80 万条工作提示词:43.5% 专业任务出现跨职能渗透

    OpenAI 发布最新职场研究报告,基于美国超过 80 万条 ChatGPT 商业账号工作消息分析发现,剔除通用办公需求后,43.5% 的具体岗位消息涉及跨职能任务。客服、设计和 HR 岗位跨界频次最高,财务计算与代码排障成为渗透率最广的跨界技能。

  13. 14
    模型上下文协议

    Anthropic 联合 AAIF 正式发布 MCP 2026-07-28 规范,协议全面转向无状态架构

    2026年7月28日,Anthropic 联合 Agentic AI Foundation 正式发布 MCP 2026-07-28 规范。作为 MCP 开源发布以来最大规模的架构升级,新规范彻底废除有状态会话与初始化握手,转向完全自描述的无状态请求模式,同时推出标头路由与官方扩展框架。

  14. 15
    Codex SecurityOpenAI

    OpenAI 开源 Codex Security CLI 与 SDK,支持代码漏洞自动验证与 Patch 修补

    2026年7月28日,OpenAI 正式在 GitHub 上以 Apache-2.0 许可证开源了 Codex Security 的 CLI 工具与 TypeScript SDK。作为一款 AI 驱动的应用安全 Agent(内部代号 Aardvark),Codex Security 突破了传统 SAST 工具依赖静态规则的局限,能够结合仓库上下文构建威胁模型,在隔离沙箱中自动验证漏洞并生成修复 Patch,大幅提升 DevSecOps 效率。

  15. 16
    Kimi K3月之暗面

    月之暗面开源 2.8 万亿参数大模型 Kimi K3,同步开放训练与算子基础设施

    月之暗面于 2026 年 7 月 27 日宣布向全球社区完整开源旗舰模型 Kimi K3 的模型权重。该模型拥有 2.8 万亿参数,采用混合线性注意力机制 KDA 与注意力残差架构,原生支持多模态及 100 万 token 上下文。团队同步开源了包含 MoonEP 分布式并行库与 FlashKDA 算子在内的全套基础设施。

  16. 17
    谷歌

    Google 发布 ATLAS 首期 AI 经济学报告:分析 1465 万条真实对话,评估 AI 职场替代效应

    Google DeepMind 联合首席经济学家办公室发布 ATLAS v1.0 报告,基于 1465 万条去标识化对话分析全球 AI 采纳特征。研究显示 AI 延伸覆盖 68% 职业但具体任务渗透率仅 21%,完全自动化不足 10%,86% 交互发生在非工作场景,非英语交互占比高达 66.7%。

  17. 18

    英伟达CEO黄仁勋专访驳斥“AI末日论”:称失业恐慌纯属一派胡言,公开力挺中国开源模型与基建扩容

    英伟达首席执行官黄仁勋在 Axios 独家专访中猛烈抨击针对 AI 的末日论调与科幻式监管政策,指出将 AI 视为人类末日或造成普遍失业完全是一派胡言。他同时高度评价中国开源 AI 模型的质量,破除开源“后门迷思”,呼吁决策者切勿只听信一两位科技巨头 CEO 的言论,并预测全球 AI 计算与能源基建在未来数年仍需扩展 5 至 10 倍。

  18. 19
    AnthropicClaude Opus 5

    Claude Opus 5 基准测试结果公布:前沿对比登顶,定义 AI 推理新标杆

    Anthropic 最新发布的 Claude Opus 5 在各项基准测试中表现亮眼。在 Humanity's Last Exam (HLE) 获得 64.7% 登顶榜首,MMLU-Pro 达到 91.59%,SWE-bench Verified 达到 97.00%,在与 GPT-5.6 Sol、Claude Fable 5、Kimi K3、Opus 4.8 等模型的横向对比中全面超越。

  19. 20
    AnthropicClaude Opus 5

    Anthropic 正式发布 Claude Opus 5

    Anthropic 于 2026 年 7 月 24 日正式发布 Claude Opus 5。该模型智力接近旗舰 Claude Fable 5,维持每百万 Token $5/$25 的价格,引入默认思考机制与 Effort 深度调节,并在安全对齐性上取得显著突破。