AI 日报

🤖 AI HOT 日报 · 2026-08-13

xAI 发布 Grok 4.6,强化长时运行智能体能力;阿里开放 Qwen3.8-2.4T-A95B 模型权重,为 Qwen-Max 级模型首次开源;微软首发自研推理模型 MAI-Thinking-1;LTX-2.5 生成 10 秒 720P 视频仅需 6.8 秒;DeepSeek V4 Pro 与 Grok 4.6 同日发布,双双逼近 Claude Fable 5 体验;OpenRouter 推出实时网页搜索基准测试;Claude in Chrome 侧边栏升级为 Claude Cowork 会话。

  1. 1. xAI 发布 Grok 4.6

    在 Grok 4.5 基础上重点强化长时运行智能体及更复杂的交互式与视觉工作能力,在多项智能体编码与知识工作基准上达到前沿水平,综合分追平 GPT-5.6 Sol。

  2. 2. 阿里开放 Qwen3.8-2.4T-A95B 模型权重

    Qwen-Max 级别模型首次开源:总参数 2.4T,每 Token 激活 95B,原生支持 262,144 Token 上下文并可扩展至 1,010,000 Token。

  3. 3. 微软首发自研推理模型 MAI-Thinking-1

    微软首个从零构建的推理模型 MAI-Thinking-1 已在 Microsoft Foundry 上线。

  4. 4. LTX-2.5 模型登场:10秒720P视频仅需6.8秒

    原生集成 ComfyUI,在 2 张 GB200 配置下生成 10 秒 720P 视频仅需 6.8 秒,Fast 版生成带音频 720p 视频成本约 0.90 美元/10 秒。

  5. 5. DeepSeek V4 Pro 正式版上线

    Agent 能力大幅提升且暂未涨价,官方测试说明还提及极简模式框架 DeepSeek Harness 即将来袭,或成为决定 Agent 能力的关键。

  6. 6. OpenRouter 推出实时网页搜索基准测试

    系统评测模型、搜索引擎、搜索方法与预算四类配置组合:搜索预算增至 25 轮可使 BrowseComp 得分近乎翻倍,且模型选择比引擎更重要。

  7. 7. Claude in Chrome 侧边栏升级为 Cowork 会话

    侧边栏对话保存至历史记录,技能和连接器可在浏览器中工作,任务可在桌面、网页和移动端应用间无缝切换。

  8. 8. WhatsApp 构建 Scam Alert 诈骗提醒功能

    在端到端加密保护下于设备端运行 ML 模型识别潜在诈骗消息,消息内容不离开设备,模型权重公开供独立验证。

  9. 9. Research Gold 号称「100%人类撰写」实为 AI 驱动

    面向医学研究者的 Research Gold 声称服务由人类撰写并列出多名博士审稿人,但调查发现审稿人为 AI 生成并不存在,电话中「Sarah」助手也实为 AI。

  10. 10. Google 研究:回忆是参数化事实性的瓶颈

    知识画像框架发现前沿 LLM 的事实编码接近饱和但回忆能力不足,多数事实错误源于「丢钥匙」而非「空货架」,并配套推出 WikiProfile 基准。

  11. 11. AutoGPT 如何管理 AI 生成的拉取请求

    通过强制 PR 模板、测试计划、CI 覆盖率门槛和 CLA 签名等门控机制,将智能体提交的 PR 从「不可用」转变为「可用但不符合路线图」。

来源与核验

这是一条旧版简报,原始来源链接未保留。涉及安全、金融、政策或突发事件的信息,请在采取行动前通过权威原始来源再次核验。