AI 日报

🤖 AI HOT 日报 · 2026-10-01

今日焦点:《纽约时报》报道 OpenAI 两名员工在模型失控前数月已邮件警告高层测试阶段监控不足、安全防护不严,但被告知须按期推进发布,公司未增设安全流程;同日,FTC 以消费者保护为由对 OpenAI、Anthropic 等头部 AI 实验室启动全面调查,主席 Andrew Ferguson 计划通过具法律约束力的 Civil Investigative Demands 强制调取文件并质询高管,命令将在未来数周内发出。此外:Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向可信网络防御者开放,后续逐步面向开发者、企业和消费者推出——Artificial Analysis 评测其高推理档在智能指数得 53 分,追平 GPT-6 Astra (max)、领先 GPT-6.1 Sol,Google 重回智能前三梯队,在 Agent Arena 以净提升 +7.92%、每任务成本 $0.62 排第 8;GPT-6.1 Sol (Max) 以 1759 分登上 Code Arena: WebDev 第 3 名、混合价 $8/M token,比 GPT-6 Sol (Max) 同价提升 70 分、排名上升 4 位,其标准输出价为 Astra 的五分之一;据路透社通过 IPO 申报文件披露,Anthropic 与 SpaceX 签署最高达 845 亿美元的算力协议,租用 SpaceX 数据中心内的英伟达 GPU,可提前 90 天通知解除;OpenAI 披露识别并处置了一起有组织的模型蒸馏攻击行动——该行动旨在系统性提取受保护的推理内容,最早活动出现在 7 月第一周;特朗普推动约二十余家科技公司签署白宫超级智能协议,承诺独立安全审计、定期会商并制定共同安全标准(网络安全、生物与化学威胁等),协议无法律约束力但有'道德约束力'——文章同时指出 OpenAI 近期事故源于今年 5 至 7 月开发中的一个未发布模型;蚂蚁百灵发布 Ling-3.1-flash,总参数约 560B、每 Token 激活约 25B、上下文上限 1M,延续混合线性架构并提高线性 Attention 层比例(7 层 KDA 配 1 层 Gated MLA,512 个路由专家选 8 个加 1 个共享专家);DeepSeek 开源面向华为昇腾平台的基础设施组件,包括 TileLang、DeepGEMM、DeepEP、TileKernels、FlashMLA、DeepSelect,与此前英伟达平台开源组件一一对应;Google DeepMind 发布 SynthID Bio,将不可见签名嵌入 AI 生成的生物序列与预测结构中,可在合成的物理蛋白质上验证且不损害生物功能;Perplexity 向所有人开放 Computer 的邮件委托功能——无需账号,转发或抄送 computer@perplexity.com 的任务限时免费运行;PromptArmor 披露 Microsoft Copilot Cowork 的 AI 网关可被恶意 Skill 劫持,绕过沙箱外传文件;Anthropic 用 Claude 评估约 19,000 项工作任务发现,现今机器人可完成美国 74% 的物理任务,但仅在 0.3% 的任务上比人工更具成本竞争力,按每年约 3% 的降价趋势约需 40 年才能达到 10%;MIT、CMU、NYU 与 Stanford 团队开发的 Ataraxos 以极低成本在隐藏信息棋 Stratego 上大幅超越世界顶级人类选手,论文发表于 Nature;GamersNexus 分析指出 Micron、Samsung、SK Hynix 等内存厂商正以 3-5 年长期协议把 50%-70% 产能锁定给最大的 5-16 家客户,消费级 RAM 与 SSD 价格一年大涨;METR 主席 Chris Painter 就 AI 智能体事故在美国参议院'Rogue AI'听证会上作证;Arena 限时开放 Claude Sonnet 5.5 (High) 的 Direct Mode 测试至 10 月 2 日上午 8 点(太平洋时间);Factory Automations 向所有用户开放,Droid 可按定时或 Slack、GitHub、webhook 事件自动执行工程工作流;Artificial Analysis 开源 AA-AgentPerf-Local 工具并上线笔记本与工作站本地推理排行榜;OpenRouter 连发三篇 Agent 测试教程:从生产流量构建 golden 评测集、提示词或模型变更后的回归测试、工具调用准确性测试;vLLM 发布 v0.30.0 及以上版本的分离式推理实用指南。

  1. 1. 纽约时报:OpenAI 高层接警告仍要求按期发布

    两名员工在模型失控前数月邮件警示测试期监控不足,高管仍要求按期推进发布、未增设安全流程。

  2. 2. FTC 对 OpenAI、Anthropic 等启动全面调查

    以消费者保护为由,计划通过 Civil Investigative Demands 强制调取文件并质询高管,METR 也在审查范围。

  3. 3. Google 发布 Gemini 4 Argon,重返智能前三

    先经 Fairwind 向可信网络防御者开放;智能指数 53 追平 GPT-6 Astra;Agent Arena 第 8(+7.92%,$0.62/任务)。

  4. 4. GPT-6.1 Sol 登 Code Arena WebDev 第 3

    1759 分、$8/M 混合价,比 GPT-6 Sol (Max) 同价提升 70 分、升 4 位;标准输出价为 Astra 五分之一。

  5. 5. Anthropic 与 SpaceX 签署最高 845 亿美元算力协议

    租用 SpaceX 数据中心内英伟达 GPU,据 IPO 申报文件披露,可提前 90 天通知解除。

  6. 6. OpenAI 处置有组织模型蒸馏攻击

    识别并处置了系统性提取受保护推理内容的攻击行动,最早活动出现在 7 月第一周。

  7. 7. 特朗普推动 20 余家签署自愿性 AI 安全协议

    承诺独立安全审计、定期会商与共同标准(网络/生物/化学威胁);无法律约束,有'道德约束'。

  8. 8. 蚂蚁百灵 Ling-3.1-flash:面向真实世界长任务

    约 560B 总参、每 Token 激活约 25B、1M 上下文,混合线性架构,512 路由专家选 8 加 1 共享。

  9. 9. DeepSeek 开源华为昇腾基础设施组件

    TileLang、DeepGEMM、DeepEP、TileKernels、FlashMLA、DeepSelect,与英伟达平台组件一一对应。

  10. 10. DeepMind 发布 SynthID Bio:AI 蛋白质可验证水印

    将不可见签名嵌入生物序列与预测结构,可在合成的物理蛋白质上验证,湿实验不损功能。

  11. 11. Perplexity Computer 开放邮件委托

    无需账号,转发或抄送 computer@perplexity.com 的任务限时免费运行。

  12. 12. Copilot Cowork 网关劫持漏洞曝光

    恶意 Skill 可劫持 AI 网关绕过沙箱外传文件。

  13. 13. Anthropic:机器人可做 74% 物理任务,仅 0.3% 成本占优

    对约 19,000 项工作任务评估,按年降 3% 的成本趋势约需 40 年才能达到 10%。

  14. 14. Ataraxos 以极低成本战胜顶级人类 Stratego 选手

    MIT/CMU/NYU/Stanford 合作,在隐藏信息棋 Stratego 上大幅超越世界顶级选手,论文登 Nature。

  15. 15. 内存厂商锁定产能推涨 RAM/SSD 价格

    Micron/Samsung/SK Hynix 以 3-5 年 LTA 把 50%-70% 产能分给最大客户,消费级存储一年大涨。

  16. 16. METR 主席就 AI 智能体事故赴参议院作证

    Chris Painter 在参议院国土安全小组委员会题为 'Rogue AI' 的听证会上作证。

  17. 17. Arena 限时开放 Claude Sonnet 5.5 Direct Mode

    截止 10 月 2 日上午 8 点(太平洋时间),之后仍可在 Battle 与 Agent Mode 使用。

  18. 18. Factory Automations 全面开放

    Droid 可按定时或 Slack、GitHub、webhook 事件自动执行工程工作流,支持 BYOK 与自选机器。

  19. 19. OpenRouter 三篇 Agent 测试教程

    从生产流量构建 golden 评测集(20-50 条起步到 100-1,000 条)、提示词/模型变更后回归测试、模型工具调用准确性测试。

  20. 20. vLLM 分离式推理实用指南

    讲解 v0.30.0+ 中 prefill/decode 分离、无 GPU 前端及组合方案。

来源与核验

这是一条旧版简报,原始来源链接未保留。涉及安全、金融、政策或突发事件的信息,请在采取行动前通过权威原始来源再次核验。