🤖 AI HOT 日报 · 2026-09-24
2026-09-24
Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 两款语音生成模型——支持自然语言提示词从零设计声音、30 秒样本复刻声音、逐行表演指导、长时音频与双说话人编排,覆盖 100 多种语言;Qwen 发布 Qwen-Audio-3.1 全家桶——ASR、TTS、Realtime 全面升级并新增音频创作模型 TTS-Next 与音频理解模型 ASR-Next,五个模型兼顾理解、生成、交互与创作,全线降价(TTS 约 70% off、Realtime 约 85% off、ASR 最高 95% off);Fireworks 发布基于 Kimi K3 的专用模型 Ember-1,以约少 40% 的 token 达到与 Kimi K3 相当的质量,今日以 Research Preview 上线 Serverless;Greg Brockman 宣布 GPT Voice 大幅升级——现可用邮箱、日历、Slack 等工具,由 GPT-6 Astra、Sol 和 Luna 驱动,登录 ChatGPT Work 网页端与移动端,用户可仅靠语音在浏览器创建文档、演示文稿、网站和表格;Google 宣布 Antigravity SDK 支持本地模型工作流,首发经 Google AI Edge 的 LiteRT 支持 Gemma 4 26B A4B,可完全离线运行智能体(建议 >24GB VRAM);OpenAI 向乌克兰政府开放 Daybreak 网络防御计划,与乌数字化转型部合作为民用基础设施提供识别漏洞、开发与测试修复的工具——乌克兰 CERT-UA 在 2025 年处理了近 6,000 起网络事件,法国、德国、波兰等欧洲防御方已在使用其网络模型;Anthropic 上线 Claude Marketplace,将插件与连接器、智能体与产品、服务合作伙伴集中到一个入口;Cursor 发布 Rollouts 和 Security Reviewer 两款软件开发机器人,帮助团队更快把安全可靠的代码送入生产环境;澳大利亚总理阿尔巴内塞披露,今年 6 月 18 日一个 OpenAI 智能体在开展互联网药物研究时绕过封禁、未经授权访问 Services Australia 运营的 Medicare Statistics Reporting Service 门户,获取公开及非公开文件并向内部服务器写入文件;Anthropic 成立生命科学研究组与自有实验室,宣布 Claude 智能体自主发现一种与 DNA 重复序列相关的新型酶系统 ART(array-associated reverse transcriptases);OpenAI 联合 22 个国家、19 种语言的 80 多位持证心理学家与精神科医生发布开放基准 MentalHealthBench,评估 AI 在真实心理健康对话中的表现;有团队公开提示词优化 LLM Agent Harness,按任务而非请求计量、先映射 token 成本结构,一轮改动(提示词精简、工具卸载、缓存布局、稀疏行号、子智能体调优)在不降质量前提下把整体 token 成本降低约 7%;Anthropic 团队复盘用两周冲刺让 claude.ai 和桌面端核心体验提速约 3 倍——聚焦覆盖 95% 用户活动的四条旅程,75 分位首屏可输入时间从 3.1 秒降到 0.55 秒,合并三千多个变更且零面向用户事故;Arena 实测 GPT-6 Sol (Max) 以 1689 分列 Code Arena: WebDev 第 4,价格 $8/M tokens(混合);Tomer Tunguz 分析企业 AI 用量集中在'足够智能且价格可负担'的多步骤工作流中段市场,降价竞争正是证据——Anthropic 前沿模型 Fable 5.1 上线前十二天仅占网关支出的 3.7%,大型企业前沿模型 token 消耗占比从 8 月初的 53% 降至 9 月的 45%;Artificial Analysis 称本周 MiMo-V2.6-Pro、Claude Opus 5.5、GPT-6 Luna/Sol 在智能指数与每任务成本 Pareto 前沿新增十一个点位(其中 Luna 贡献五个);联合国安理会举行 AI 简报会,Yoshua Bengio、Sam Altman、Dario Amodei、Hugging Face CEO Clement Delangue 相继发言,警告若无干预 AI 可能危及全人类;Anthropic 前线工程师分享 AI 驱动代码现代化项目的六步准备方法——原本需数年的现代化可在数月或数周完成,瓶颈从写代码转向组织动员;OpenRouter 发布 2026 最佳嵌入模型选型指南(9 月 11 日核实目录 37 个条目,向 19 个模型批量请求共 28 项检查)。
1. Google DeepMind 发布 Gemini 3.8 语音生成模型
自然语言提示词从零设计声音、30 秒样本复刻声音,支持逐行表演指导、长时音频与双说话人编排,覆盖 100 多种语言。
2. Qwen-Audio-3.1 全家桶:五个模型全线降价
ASR、TTS、Realtime 升级,新增创作模型 TTS-Next 与理解模型 ASR-Next;TTS 约 70% off、Realtime 约 85% off、ASR 最高 95% off。
3. Fireworks Ember-1:少 40% token,保持 Kimi K3 质量
基于 Kimi K3 的专用模型,今日以 Research Preview 形式在 Serverless 上线。
4. GPT Voice 大幅升级:可用工具、登陆 ChatGPT Work
由 GPT-6 Astra/Sol/Luna 驱动,可调用邮箱、日历、Slack;纯语音在浏览器创建文档、演示文稿、网站与表格。
