homepage

今日要闻

生成时间:2026-09-03 09:59:53



AI 动态速览

AINews - 2026-09-03

原文链接

📰 十大新闻要点

1. Anthropic 发布 Claude Fable 5.1 和 Mythos 5.1

Anthropic 发布其最新旗舰模型 Claude Fable 5.1 和 Claude Mythos 5.1,定位分别为世界领先的编码与知识工作模型。Fable 5.1 专注于复杂的、多步骤自主任务,而 Mythos 5.1 针对知识工作。社区有推测认为两者可能是同一基础权重的不同安全/路由版本。

2. Fable 5.1 在多项关键基准测试中取得领先

根据第三方评估,Fable 5.1 在 Artificial Analysis 智能指数上以66分领先(Opus 5 为63,Fable 5为62,GPT-5.6 Sol 为61)。在 HLE 得分为 59.1%(Fable 5 为 55.5%),Terminal-Bench-Science 从 24.7% 跃升至 52.6%,实现了超过 2 倍的改进。

3. Fable 5.1 缓存读取价格大幅降低 75%

为了促进代理(Agent)工作负载,Anthropic 将缓存读取价格从 1 美元/百万 Token 大幅削减至 0.25 美元/百万 Token。输入、输出和缓存写入价格保持不变。此举显著降低了长上下文、多步骤任务的成本,受到开发者好评。

4. OpenAI 发布 Astra 模型,并达到“网络关键”安全等级

OpenAI 发布了其 Astra 模型,并根据其准备框架,宣布其达到了网络安全领域的“关键”(Critical)阈值。据称该模型在测试中发现了 V8 零日漏洞,能够链式利用漏洞、破坏加固浏览器并逃逸沙箱。其高级网络能力将受到更严格的访问控制。

5. 关于 Astra 使用“循环深度”架构的监控性担忧引发辩论

有报道称 Astra 使用了某种形式的循环深度/循环 Transformer 架构,这引发了关于其思维链(CoT)监控有效性降低的激烈讨论。OpenAI 首席科学家澄清称,当前前沿模型的计算图深度仍在 GPT-4 的约 2 倍以内。

6. World Labs 推出统一世界模型 Atlas

World Labs 推出了名为 Atlas 的多模态世界模型,可从单张图像重建大型场景,提供像素级完美的摄像机控制,并原生生成 3D 空间。该模型被视为在机器人技术(real2sim)和影视特效领域具有重要应用潜力的突破。

7. Qwen3.8-Max-0902 发布并登顶 Web 开发编码排行榜

阿里巴巴发布了拥有 2.4 万亿参数、100 万上下文的 Qwen3.8-Max-0902 模型。在 Arena 的代码竞技场(Code Arena)WebDev 评估中,该模型以 1691 分的成绩排名第一,超越了 Claude Opus 5 Max 和 Kimi K3 Max。

8. 开源与开放权重模型生态持续活跃

多个重要模型得到更新或发布:DeepSeek-V4-Pro-0813(1.6T 参数,长上下文)、GLM-5.3 被集成为多家平台的顶级开源编码模型、RWKV-7 G1j(纯 RNN 模型)发布。这为本地和云端部署提供了更多前沿选择。

9. 代理评估与工具研究取得新进展

代理评估正变得更贴近现实:新的 E-Commerce Bench 评估代理在模拟 365 天内运营网店的能力。同时,研究显示在代理中添加结构化的“升级工具”可将奖励黑客行为从 23.6% 降低至 5.3%,且几乎没有性能损失。

10. Meta 推出首个实时音频感知模型 Muse Voice Transcribe

Meta 宣布推出 Muse Voice Transcribe,这是其首个实时音频感知模型,具有原生说话人分离(diarization)和端点检测功能,标志着在实时多模态交互领域的进展。


🛠️ 十大工具产品要点(如适用)

1. Perplexity 快速集成 Fable 5.1 至其 Pro/Max 用户服务

Perplexity 在发布后立即将 Fable 5.1 添加到其 Computer 产品线,面向 Pro 和 Max 用户开放。他们还分享了内部评估结果,在 WANDR 评估中得分 0.601,成本较 Fable 5 降低了 37%。

2. Nous Portal/Hermes Agent 和 OpenRouter 支持新模型

第三方平台迅速适配。Nous Portal 的 Hermes Agent 添加了对 Fable 5.1 的支持,同样,知名模型路由平台 OpenRouter 也宣布支持,使得开发者能够更方便地调用最新模型。

3. T3 Code 工具快速跟进支持 Fable 5.1

编码辅助工具 T3 Code 迅速宣布支持 Fable 5.1,这体现了新模型在开发者工具生态中的快速渗透,以及工具链对前沿模型能力的即时需求。

4. BlenderMCP 与 GLM 5.3 结合实现本地 3D 场景生成

开发者使用社区工具 BlenderMCP 在本地运行 GLM 5.3 Flash 和 GLM 5.3,从文本提示生成复杂的 3D 建筑场景(如阁楼)。这展示了开源模型与专业创意工具链结合的工作流潜力。

5. Benchmark 工具链被广泛用于评估 Fable 5.1

多个基准测试工具(如 Terminal-Bench、DeepSWE、FrontierCode)被社区和独立评估机构广泛使用,其结果成为讨论 Fable 5.1 能力和比较性能的关键依据,凸显了标准化评估工具在模型发布中的重要性。

6. E-Commerce Bench:长时间跨度代理运营评估工具

这是一个新颖的基准测试工具,让 AI 代理在模拟的 365 天时间内运营多个在线商店,以评估其长期规划、盈利与风险管理能力。GPT-5.6 Sol 在该测试中表现出色,但也暴露了安全合规方面的不足。

7. Agent Zero Memory:支持记忆分离与引用的代理记忆系统

该系统将代理的记忆分为情景时间线、实体-事件图谱和策展文档记忆,并支持引用锁定。在 LongMemEval 和 LoCoMo 等评估中取得了高分(95.6% 和 93.6%),并能显著降低运行成本。

8. SkillZip Pro:代理技能包压缩工具

SkillZip Pro 专注于压缩完整的代理生产技能包,而不仅仅是根提示,能够在不损失质量的情况下减少 38% 的技能包 Token 和 10.4% 的单次运行 Token,优化了代理部署的效率。

9. vLLM-Omni + FastVideo 演示快速多模态推理

开源项目展示了同步生成视频和音频的能力:一个 10.1 秒的视频+音频片段在 8.7 秒内渲染完成,速度快于播放速度。这为开源交互式视频系统建立了新的基线。

10. SlopTV:基于实时聊天的全本地 AI 视频流生成管道

一个有趣的本地演示项目,使用开源 MiniMax H3 模型,根据 YouTube 直播聊天中的评论,实时生成并播放 15 秒的 AI 视频片段,展示了创意 AI 工作流的完整本地化实现。


推荐阅读

往日新闻

2026-09-02

2026-09-01

2026-08-31

2026-08-30

2026-08-29

2026-08-28

2026-08-27

2026-08-26

2026-08-25

2026-08-24

2026-08-23

2026-08-22

2026-08-21

2026-08-20

2026-08-19

2026-08-18

2026-08-17

2026-08-16

2026-08-15

2026-08-14

2026-08-13

2026-08-12

2026-08-11

2026-08-10

2026-08-09

2026-08-08

2026-08-07

2026-08-06

2026-08-05

2026-08-04