🤖 AI HOT 日报 · 2026-09-16
2026-09-16
Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 两个近实时语音对话模型,主打语音智能体与复杂任务执行;生数科技发布 Vidu S2,含面向数字角色实时交互的 Avatar 与面向视频流实时编辑的 Editing 双模型,并探索针对 VR 头显的实时空间视频生成编辑;阶跃星辰发布 StepAudio 3 系列——Realtime、ASR、TTS、Gen、Music 五款语音大模型,多款在 Artificial Analysis 榜单登顶全球第一;Google 语言技术已覆盖 300 多种语言、触及全球 86% 人口,同时发布基于 Gemini 训练、支持 55 种语言、可离线运行的轻量开源翻译模型 TranslateGemma;Anthropic 为 Claude for Small Business 新增 43 个工作流与 27 个集成(覆盖 Shopify、Salesforce、Stripe、Gusto 等),自 5 月上线以来安装超 90 万次,默认审批模式、发送/发布/付款均需用户确认,并推出免费培训;Perplexity 自研键值数据库 CobbleDB 替代 AWS DynamoDB 支持快速网页抓取,两名工程师加数百个持续运行的 Computer 智能体两个月建成核心,每年最多省 1 亿美元;Pragmatic Engineer 探访 OpenAI:约一个月前起 Codex 与 ChatGPT Work 已成公司几乎所有工作的基础,现场实为'智能体软件工厂';Anthropic 与 OpenAI 提议行业与政府协调放缓前沿开发并寻求反垄断豁免、Altman 与马斯克表示同意,Cohere CEO 等质疑其真实动机;404 Media 曝光 OpenAI'莉莉计划'——时薪超 50 美元的审核员查看匿名化真实用户聊天记录,评判回答是否切题、有无 AI 式话术与谄媚;Arena Image-to-WebDev 榜单更新,GPT-6 Astra 以 1733 分居首、领先 GPT-5.6 Sol 129 分,Claude Fable 5.1 以 1710 分列第二;Artificial Analysis 发布 Speech to Speech Index,GPT-Live-1(Astra 后端、medium 推理)以 81.5 分登顶,略胜 Grok Voice Think Fast 2.0 High 的 81.3;Trail of Bits 批评 1Password 的 AI 补丁基准具误导性,指其 26% 干净修复率受四项实验设计选择影响而失真;Vercel 将 inbound 销售团队从 10 人压缩至 1.25 人——90% 销售开发自动化,AI SDR 智能体一年成本仅数千美元。
1. Gemini 3.8 Live:近实时语音 + Extended Thinking
DeepMind 推出两个近实时语音对话模型,主打语音智能体与复杂任务执行,将实时语音下限推向更高水位。
2. 生数科技发布 Vidu S2:Avatar + Editing 双模型
面向数字角色实时交互的 Vidu S2-Avatar、面向视频流实时编辑的 Vidu S2-Editing,并探索 VR 头显上的实时空间视频生成与编辑。
3. 阶跃星辰 StepAudio 3:多款语音榜全球第一
Realtime、ASR、TTS、Gen、Music 五款语音大模型齐发并上线开放平台,多款在 Artificial Analysis 榜单登顶。
4. Google:300 多种语言 + 开源翻译模型 TranslateGemma
语言技术覆盖全球 86% 人口;基于 Gemini 训练、支持 55 种语言、可离线运行的轻量开源翻译模型也同步发布。
