🤖 AI HOT 日报 · 2026-08-13
xAI 发布 Grok 4.6,强化长时运行智能体能力;阿里开放 Qwen3.8-2.4T-A95B 模型权重,为 Qwen-Max 级模型首次开源;微软首发自研推理模型 MAI-Thinking-1;LTX-2.5 生成 10 秒 720P 视频仅需 6.8 秒;DeepSeek V4 Pro 与 Grok 4.6 同日发布,双双逼近 Claude Fable 5 体验;OpenRouter 推出实时网页搜索基准测试;Claude in Chrome 侧边栏升级为 Claude Cowork 会话。
1. xAI 发布 Grok 4.6
在 Grok 4.5 基础上重点强化长时运行智能体及更复杂的交互式与视觉工作能力,在多项智能体编码与知识工作基准上达到前沿水平,综合分追平 GPT-5.6 Sol。
2. 阿里开放 Qwen3.8-2.4T-A95B 模型权重
Qwen-Max 级别模型首次开源:总参数 2.4T,每 Token 激活 95B,原生支持 262,144 Token 上下文并可扩展至 1,010,000 Token。
3. 微软首发自研推理模型 MAI-Thinking-1
微软首个从零构建的推理模型 MAI-Thinking-1 已在 Microsoft Foundry 上线。
4. LTX-2.5 模型登场:10秒720P视频仅需6.8秒
原生集成 ComfyUI,在 2 张 GB200 配置下生成 10 秒 720P 视频仅需 6.8 秒,Fast 版生成带音频 720p 视频成本约 0.90 美元/10 秒。
5. DeepSeek V4 Pro 正式版上线
Agent 能力大幅提升且暂未涨价,官方测试说明还提及极简模式框架 DeepSeek Harness 即将来袭,或成为决定 Agent 能力的关键。
6. OpenRouter 推出实时网页搜索基准测试
系统评测模型、搜索引擎、搜索方法与预算四类配置组合:搜索预算增至 25 轮可使 BrowseComp 得分近乎翻倍,且模型选择比引擎更重要。
7. Claude in Chrome 侧边栏升级为 Cowork 会话
侧边栏对话保存至历史记录,技能和连接器可在浏览器中工作,任务可在桌面、网页和移动端应用间无缝切换。
8. WhatsApp 构建 Scam Alert 诈骗提醒功能
在端到端加密保护下于设备端运行 ML 模型识别潜在诈骗消息,消息内容不离开设备,模型权重公开供独立验证。
9. Research Gold 号称「100%人类撰写」实为 AI 驱动
面向医学研究者的 Research Gold 声称服务由人类撰写并列出多名博士审稿人,但调查发现审稿人为 AI 生成并不存在,电话中「Sarah」助手也实为 AI。
10. Google 研究:回忆是参数化事实性的瓶颈
知识画像框架发现前沿 LLM 的事实编码接近饱和但回忆能力不足,多数事实错误源于「丢钥匙」而非「空货架」,并配套推出 WikiProfile 基准。
11. AutoGPT 如何管理 AI 生成的拉取请求
通过强制 PR 模板、测试计划、CI 覆盖率门槛和 CLA 签名等门控机制,将智能体提交的 PR 从「不可用」转变为「可用但不符合路线图」。
来源与核验
这是一条旧版简报,原始来源链接未保留。涉及安全、金融、政策或突发事件的信息,请在采取行动前通过权威原始来源再次核验。