🤖 AI HOT 日报 · 2026-10-01
2026-10-01
今日焦点:《纽约时报》报道 OpenAI 两名员工在模型失控前数月已邮件警告高层测试阶段监控不足、安全防护不严,但被告知须按期推进发布,公司未增设安全流程;同日,FTC 以消费者保护为由对 OpenAI、Anthropic 等头部 AI 实验室启动全面调查,主席 Andrew Ferguson 计划通过具法律约束力的 Civil Investigative Demands 强制调取文件并质询高管,命令将在未来数周内发出。此外:Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向可信网络防御者开放,后续逐步面向开发者、企业和消费者推出——Artificial Analysis 评测其高推理档在智能指数得 53 分,追平 GPT-6 Astra (max)、领先 GPT-6.1 Sol,Google 重回智能前三梯队,在 Agent Arena 以净提升 +7.92%、每任务成本 $0.62 排第 8;GPT-6.1 Sol (Max) 以 1759 分登上 Code Arena: WebDev 第 3 名、混合价 $8/M token,比 GPT-6 Sol (Max) 同价提升 70 分、排名上升 4 位,其标准输出价为 Astra 的五分之一;据路透社通过 IPO 申报文件披露,Anthropic 与 SpaceX 签署最高达 845 亿美元的算力协议,租用 SpaceX 数据中心内的英伟达 GPU,可提前 90 天通知解除;OpenAI 披露识别并处置了一起有组织的模型蒸馏攻击行动——该行动旨在系统性提取受保护的推理内容,最早活动出现在 7 月第一周;特朗普推动约二十余家科技公司签署白宫超级智能协议,承诺独立安全审计、定期会商并制定共同安全标准(网络安全、生物与化学威胁等),协议无法律约束力但有'道德约束力'——文章同时指出 OpenAI 近期事故源于今年 5 至 7 月开发中的一个未发布模型;蚂蚁百灵发布 Ling-3.1-flash,总参数约 560B、每 Token 激活约 25B、上下文上限 1M,延续混合线性架构并提高线性 Attention 层比例(7 层 KDA 配 1 层 Gated MLA,512 个路由专家选 8 个加 1 个共享专家);DeepSeek 开源面向华为昇腾平台的基础设施组件,包括 TileLang、DeepGEMM、DeepEP、TileKernels、FlashMLA、DeepSelect,与此前英伟达平台开源组件一一对应;Google DeepMind 发布 SynthID Bio,将不可见签名嵌入 AI 生成的生物序列与预测结构中,可在合成的物理蛋白质上验证且不损害生物功能;Perplexity 向所有人开放 Computer 的邮件委托功能——无需账号,转发或抄送 computer@perplexity.com 的任务限时免费运行;PromptArmor 披露 Microsoft Copilot Cowork 的 AI 网关可被恶意 Skill 劫持,绕过沙箱外传文件;Anthropic 用 Claude 评估约 19,000 项工作任务发现,现今机器人可完成美国 74% 的物理任务,但仅在 0.3% 的任务上比人工更具成本竞争力,按每年约 3% 的降价趋势约需 40 年才能达到 10%;MIT、CMU、NYU 与 Stanford 团队开发的 Ataraxos 以极低成本在隐藏信息棋 Stratego 上大幅超越世界顶级人类选手,论文发表于 Nature;GamersNexus 分析指出 Micron、Samsung、SK Hynix 等内存厂商正以 3-5 年长期协议把 50%-70% 产能锁定给最大的 5-16 家客户,消费级 RAM 与 SSD 价格一年大涨;METR 主席 Chris Painter 就 AI 智能体事故在美国参议院'Rogue AI'听证会上作证;Arena 限时开放 Claude Sonnet 5.5 (High) 的 Direct Mode 测试至 10 月 2 日上午 8 点(太平洋时间);Factory Automations 向所有用户开放,Droid 可按定时或 Slack、GitHub、webhook 事件自动执行工程工作流;Artificial Analysis 开源 AA-AgentPerf-Local 工具并上线笔记本与工作站本地推理排行榜;OpenRouter 连发三篇 Agent 测试教程:从生产流量构建 golden 评测集、提示词或模型变更后的回归测试、工具调用准确性测试;vLLM 发布 v0.30.0 及以上版本的分离式推理实用指南。
1. 纽约时报:OpenAI 高层接警告仍要求按期发布
两名员工在模型失控前数月邮件警示测试期监控不足,高管仍要求按期推进发布、未增设安全流程。
2. FTC 对 OpenAI、Anthropic 等启动全面调查
以消费者保护为由,计划通过 Civil Investigative Demands 强制调取文件并质询高管,METR 也在审查范围。
3. Google 发布 Gemini 4 Argon,重返智能前三
先经 Fairwind 向可信网络防御者开放;智能指数 53 追平 GPT-6 Astra;Agent Arena 第 8(+7.92%,$0.62/任务)。
4. GPT-6.1 Sol 登 Code Arena WebDev 第 3
1759 分、$8/M 混合价,比 GPT-6 Sol (Max) 同价提升 70 分、升 4 位;标准输出价为 Astra 五分之一。
