🤖 AI HOT 日报 · 2026-09-23
Anthropic 发布 Claude Opus 5.5——Claude 5.5 系列首个模型,在多数任务上达到 Fable 5.1 水平、典型负载成本较 Opus 5 低 40%,定价 $4/$20 每百万输入/输出 token、缓存读取降 60% 至 $0.20、输出提速超 30%(Fast mode 最高 2.5x 速度但 token 价格翻倍),支持 1M 上下文,并已成为 Claude Code v2.1.280 的默认 Opus 模型;Artificial Analysis 评测其以 58 分登顶智能指数(历史最高)、在 Terminal-Bench 4.0 上(59.6%)与 GPT-6 Astra 持平,并进入 Arena Agent Arena;Boris Cherny 实测让 Opus 5.5 与 Fable 5.1 各自把 HAProxy 从 C 移植到 Rust,两者均几乎全过测试,但 Opus 5.5 仅用 9.5 小时且更便宜;OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna,把 GPT-6 Astra 的训练方法用于更快更便宜的模型,API 价格较 GPT-5.6 促销价降 50%(Sol 输入 $4→$2、输出 $20→$10;Luna 输入 $0.20→$0.10、输出 $1.20→$0.50),即日起面向 Plus/Pro/Business/Enterprise/Edu 推送至 ChatGPT Work 和 Codex;OpenAI 还为 GPT-6 推出改进的提示词缓存系统——对 30 分钟窗口内复用的合格共享前缀提供最高 90% 的缓存输入 token 折扣;通义千问开源 Qwen-Image-2.1,以 1367 分登顶 Arena Image Edit Arena 开源第一、总榜第 16(距 GPT-Image-1.5-high-fidelity 仅 3 分),同时登顶 Text-to-Image Arena 开源第一;Hugging Face 宣布 transformers 支持直接加载 GGUF 量化模型(from_pretrained 传入 gguf_file 即可,复用 ggml 的 Metal 内核);OpenRouter 推出 Batch API,异步批量请求 24 小时窗口内完成、通常按正常价格 50% 或更低收费,已支持 70 多个模型;Kimi 发布浏览器扩展(前身 Kimi WebBridge)——可在侧边栏对话、导航网页、填写表单,重复性任务可录制一次操作保存为 skill 让 Kimi 接手执行;LlamaIndex 发布 LiteParse 2.14.6,通过自维护 PDFium fork 内存分配优化(内置 mimalloc)把文本提取耗时降低 20-25%、平均 2.76ms/页;Apple 新款 Mac mini(M6/M5 Pro)与 Mac Studio(M5 Max/M5 Ultra)9 月 22 日开售,Mac mini AI 性能最高提升 4 倍;据 Bloomberg 援引未公开的五角大楼内部审查,美军今年 2 月开战首日误击伊朗 Minab 的 Shajarah Tayyebeh 小学致超 150 人死亡(至少 123 名儿童),过度依赖 Palantir 的 Maven Smart System 是原因之一;Meta AI 助手 Muse 曝出严重 0-day 漏洞——任何本地应用或终端命令都可获取用户 Muse 账户认证 token 获得智能体完全控制,Patrick Wardle 已开发写恶意文件、拍照等 PoC,Meta 在披露约 12 小时后发布热修复,此前 Amazon 已开始封禁 Muse;Epoch AI 报告称过去三年达到同等 AI 性能的成本平均每季度下降约 47%(每年约 13 倍),刚达 SOTA 的性能成本每季度下降 66%;卡兹克实测 Grok 4.7 与小米 MiMo V2.6,认为 Grok 4.7 低于预期,MiMo V2.6 成为性能、价格、速度三角的当前版本答案;Artificial Analysis 评测阶跃星辰 Step 5 Preview 智能指数得 44 分(与 Kimi K3 max 持平,略低于 GLM-5.3 和 Qwen3.8 Max 的 45 分),成本约为同级模型 1/2.8;OpenRouter 用 Banking77 的 3,080 条客服语料对比 Jev 1.13 与 Claude Opus 5:Jev 准确率 81.0%(低 3.3 个百分点),但中位延迟 175ms 约为 Opus(2,266ms)的 1/13,成本约 1/25;OpenRouter 解读 NVIDIA Nemotron 3.5 Lightning——30B 总参/约 3B 激活的 MoE 开源权重模型,定位高频、边界清晰的 Agent 执行步骤(工具调用、编码),与负责复杂推理的 Nemotron 3 Ultra(550B)搭档。
1. Anthropic 发布 Claude Opus 5.5:多数任务达 Fable 5.1 水平,成本低 40%
Claude 5.5 系列首发;典型负载成本较 Opus 5 低 40%,$4/$20 每百万 token、缓存读取 $0.20(-60%)、输出提速 30%+,支持 1M 上下文。
2. Opus 5.5 登顶 AA 智能指数 58 分,Terminal-Bench 持平 Astra
Artificial Analysis 历测最高分(58),Terminal-Bench 4.0 达 59.6% 与 GPT-6 Astra 持平;并已进入 Arena Agent Arena。
3. Cherny 实测:Opus 5.5 移植 HAProxy 比 Fable 5.1 快且省
两者把 HAProxy 从 C 移植到 Rust 均几乎全过测试,Opus 5.5 用时 9.5 小时,更快也更便宜。
4. OpenAI 发布 GPT-6 Sol 与 Luna,API 价格降 50%
沿用 Astra 训练方法打造更快更便宜的模型;Sol $2/$10、Luna $0.10/$0.50 每百万 token,即日起推向 ChatGPT Work 与 Codex。
5. GPT-6 改进提示词缓存:最高 90% 折扣
30 分钟窗口内复用的合格共享前缀,默认提高命中率,最高提供 90% 的缓存输入 token 折扣。
6. Qwen-Image-2.1 开源:登顶 Arena 图像编辑开源第一
Image Edit Arena 1367 分居开源第一、总榜第 16(距 GPT-Image-1.5-high-fidelity 仅 3 分);同步登顶 Text-to-Image 开源第一。
7. transformers 原生支持加载 GGUF 量化模型
from_pretrained 传入 gguf_file 即可加载 Hub 上的 GGUF checkpoint,复用 ggml 的 Metal 内核,本地推理性能接近 llama.cpp。
8. OpenRouter 推出 Batch API:批量推理半价
异步批量请求由供应商在 24 小时窗口内完成,通常按正常 per-token 价格 50% 或更低收费,已支持 70 多个模型。
9. Kimi 发布浏览器扩展:可录制操作存为 skill
前身 Kimi WebBridge;侧边栏对话、导航网页、填写表单,重复性任务录制一次后由 Kimi 接手执行。
10. LiteParse 2.14.6:PDF 文本提取提速 20-25%
通过自维护 PDFium fork 的内存分配优化(内置 mimalloc),平均 2.76ms/页,markdown 渲染 3.94ms/页。
11. 新款 Mac mini 与 Mac Studio 今日开售
Mac mini 搭载 M6 与 M5 Pro,AI 性能最高提升 4 倍;Mac Studio 提供 M5 Max 与 M5 Ultra。
12. 五角大楼审查:过度依赖 Palantir AI 致误击伊朗学校
据未公开审查,美军 2 月开战首日误击 Minab 的 Shajarah Tayyebeh 小学,超 150 人死(至少 123 名儿童),Maven Smart System 过度依赖是原因之一。
13. Meta Muse 曝严重 0-day:本地应用可劫持令牌
任意本地应用或终端命令可获取 Muse 认证 token 实现完全控制;Patrick Wardle 给出写文件、拍照等 PoC,Meta 约 12 小时后打热补丁。
14. Epoch AI:同等 AI 性能的成本每季度降约 47%
三年内达到同等性能的成本平均每季度降约 47%(约每年 13 倍);刚达 SOTA 的性能成本每季度降 66%。
15. 卡兹克实测:Grok 4.7 低于预期,MiMo V2.6 成版本答案
同日出炉的两款模型对比下,Grok 4.7 未达预期,小米 MiMo V2.6 成为性能、价格、速度三角的当前版本答案。
16. AA 评测 Step 5 Preview:44 分,成本约同级 1/2.8
智能指数 44(与 Kimi K3 max 持平,略低于 GLM-5.3 与 Qwen3.8 Max 的 45),成本约为同级模型 1/2.8。
17. Jev vs Opus 5 分类实测:快 13 倍、省 25 倍
准确率 81.0%(低 3.3 个百分点),但中位延迟 175ms(Opus 为 2,266ms)、成本约 1/25。
18. NVIDIA Nemotron 3.5 Lightning:Agent 高频执行专用
30B 总参/约 3B 激活的开源 MoE,定位工具调用、编码等高频边界清晰步骤,与 550B 的 Nemotron 3 Ultra 搭档负责复杂推理。
来源与核验
这是一条旧版简报,原始来源链接未保留。涉及安全、金融、政策或突发事件的信息,请在采取行动前通过权威原始来源再次核验。