🤖 AI 日报 · 2026-07-25
Anthropic发布Claude Opus 5智能接近Fable 5价格减半;蚂蚁百灵Ling-3.0-flash原生混合推理124B参数仅5.1B激活;Black Forest Labs发布FLUX 3多模态模型支持20秒视频与原生音频;Midjourney V8.2专注美学提升;Runway Agent推出自然语言工作流;Claude Code v2.1.219支持Opus 5与1M上下文;英伟达微软Meta联合警告勿过度监管开放权重模型;Kimi K3网络安全测试大幅落后美国前沿模型;Anthropic发布Drone-Bench评估AI操控无人机;Apple提出LEAD破解长程推理瓶颈。
1. Anthropic发布Claude Opus 5,智能接近Fable价格减半
Claude Opus 5智能水平接近Fable 5但价格减半,Frontier-Bench性能超Opus 4.8两倍以上,ARC-AGI 3得分是次优模型三倍,成为Claude Max默认模型。
2. 蚂蚁百灵Ling-3.0-flash:124B参数仅5.1B激活
蚂蚁百灵发布Ling-3.0-flash原生混合推理模型,124B总参数仅5.1B激活,对标超越上一代旗舰Ring-2.6-1T,采用线性注意力与1/64稀疏MoE架构。
3. Black Forest Labs发布FLUX 3,支持20秒视频与原生音频
FLUX 3多模态基础模型联合训练图像、视频和音频,单次生成最长20秒视频并附带原生音频,已与机器人公司mimic合作在奥迪生产线测试。
4. Midjourney V8.2发布:专注美学提升
Midjourney推出V8.2图像模型,重点提升美学质量与个性化表现,低质量图像频率显著降低,个性化功能更精准理解用户审美偏好。
5. Runway Agent推出自然语言工作流功能
Runway Agent引入自然语言构建、运行或编辑节点工作流功能,可大规模解锁高质量视频输出。
6. 英伟达微软Meta联合警告:勿过度监管开放权重模型
三家公司签署公开信警告过度监管将削弱美国AI竞争力,强调开放权重模型促进创新降低门槛。OpenAI和Anthropic未签署。
7. Kimi K3网络安全测试大幅落后美国前沿模型
英美联合评估显示,Kimi K3在ExploitBench上得分32.2%,远低于美国领先模型的76.2%,但优于智谱GLM-5.2的24.4%,知识蒸馏或为原因。
8. Anthropic发布Drone-Bench:评估AI自主操控无人机
Anthropic与Andon Labs推出Drone-Bench,测试AI模型自主操控四旋翼无人机在室内定位追踪人员的能力,分解为3D重建、导航、目标检测等子任务。
9. Apple提出LEAD方法破解长程推理瓶颈
Apple研究发现LLM在长程执行中存在「不可恢复瓶颈」,提出LEAD方法通过短程未来验证与聚合打破少数困难步骤的持续错误累积。
10. Claude 5代模型上下文工程新规则:系统提示精简超80%
Anthropic为Opus 5和Fable 5等新模型删除了Claude Code超过80%的系统提示词,编码评测无显著损失,重新定义上下文工程规则。
来源与核验
这是一条旧版简报,原始来源链接未保留。涉及安全、金融、政策或突发事件的信息,请在采取行动前通过权威原始来源再次核验。