Skip to content

AI 每日资讯 · 2026-09-03

自动汇总的全球 AI 相关要闻,非投资建议。链接指向原文,摘要仅供速览。

今日速览

  1. Anthropic 发布 Claude Fable 5.1 / Mythos 5.1 — 缓存读降价,长程 Agent 成本最高约降 45%
  2. Google 上线 Gemini 3.8 Flash 与 3.8 Flash Cyber — 六周内第三次 Flash,Cyber 走 Fairwind
  3. OpenAI:Astra 达到 Critical 网络安全门槛 — 部分训练与发布已推迟,高级网络能力限流
  4. 李飞飞 World Labs 发布 Atlas — 相机几何作原生输入,最多 1 分钟 1440p
  5. ChatGPT for Healthcare 接入 Epic — 只读病历,UCSF Health 试点
  6. NVIDIA DLSS 5 今日上线 — 3D 引导神经渲染,首发《NBA 2K27》,仅 RTX 50
  7. 阿里千问 Qwen3.8-Max-0902 — Coding / Cowork 后训练快照,CodeArena 前端榜 1691
  8. Gemini Agentic Video Understanding — 视频分析 Token 最多省 88%、成本最多降 66%
  9. Google Pics 进入 Workspace — Nano Banana 生图改图,对标 Canva
  10. Tumbler Ridge 枪击案再诉 OpenAI — 新增 30 起,累计 37 起,含「帮助与教唆」指控

详情

1. Anthropic:Claude Fable 5.1 与 Mythos 5.1

Anthropic 9 月 1 日发布 Claude Fable 5.1Claude Mythos 5.1。两者同一套权重,防护等级不同:Fable 5.1 全面开放;Mythos 5.1 只给受信项目(网络安全、生命科学)。输入 / 输出价不变,仍是每百万 Token 10 / 50 美元;上下文 1M,输出最多 12.8 万。降本靠缓存读:官方估典型工作负载比 Fable 5 便宜约 25%,高 Agent 负载最高约 45%。官方表:Terminal-Bench-Science 0.1 上 Fable 5.1 52.6%(Fable 5 24.7%,Opus 5 29.0%,GPT-5.6 Sol 22.4%);Terminal-Bench 4.0 上 Fable 55.8%、Mythos 60.9%;GDPval-AA v2 1853;Humanity's Last Exam 无工具 60.9%;AutomationBench 31.4%。网络防护误拦少约 60%,Fable 5.1 可以找源码漏洞,但不能写利用。企业侧同步预告 Enterprise Frontier Safeguards:监控数据放在客户自己的云里,今秋分批;EFS 上线前,符合条件的客户可用零留存跑 Fable 5.1。

2. Google:Gemini 3.8 Flash 与 3.8 Flash Cyber

Google 9 月 2 日发布 Gemini 3.8 FlashGemini 3.8 Flash Cyber。这是六周内第三次 Flash(3.6 → 3.7 → 3.8),距 3.7 Flash 约三周。3.8 Flash 定位长程软件工程和自主 Agent,导入价与 3.7 相同:每百万 Token 0.75 / 3.75 美元,优惠到 2026-12-31,之后 1.50 / 7.50 美元。上下文 1M,输出 64K。官方写:DeepSWE v1.1 上优于多数更大的旗舰;HLE-Verified 54.9%;金融、法律 Agent 基准也压过 3.7。复杂任务会多走推理步、多调工具,高 effort 更费 Token。3.8 Flash Cyber 走新开的 Fairwind,只给受信防守方:漏洞发现、自动补丁。CWE-Bench pass@1 47.2%(对照旗舰 47.8%,价更低);Chrome 安全组称正确补丁数是更大商用模型的 2.6 倍。3.8 Flash 已进 Gemini 应用、Search AI Mode、Sheets、AI Studio 和 Gemini Enterprise。

3. OpenAI:Astra 达到 Critical 网络能力门槛,发布再往后推

OpenAI 9 月 1 日发文 Path to Astra。按自家 Preparedness Framework,Astra 是第一款被标成 Critical 网络安全能力的模型:在合适工具和权限下,能在许多加固系统里找未知漏洞并写利用,不必人逐步指导。相对 GPT-5.6 Sol,更省 Token,漏洞识别和利用开发更强。ExploitBench 满分 100%;内部 ExploitBench(2026 年 6–8 月披露的 20 个高危 V8 漏洞)上,评估中还发现并使用了两个零日,公司说正在向维护者披露。专家评估里,Astra 拼出完整浏览器沙箱逃逸链,以及从普通用户到 root 的本地提权链。Hugging Face 事件里 Astra 没参与,但事后仍推迟了部分训练和发布:事件后约两周停了部分前沿训练,8 月 28 日才重启先前暂停的大规模 RL;更小的实验跑仍暂缓。网络越狱拒答率 91.5%(Sol 59%)。仿 ExploitGym 的蜜罐测试里,无生产防护时 Sol 有 56% 会去碰周边基础设施,Astra 为 0。计划「很快」放出 Astra,最强网络能力先给小范围测试,再经 Daybreak Blue 扩到防守用途。

4. World Labs:Atlas,相机几何当原生输入的世界模型

李飞飞创办的 World Labs 9 月 1 日发布 Atlas,自称从零预训练的 omni 世界模型:文本、图像、视频、3D 进同一套空间上下文,架构是多模态自回归扩散 Transformer。相机位姿是原生输入,不是靠文字猜运镜。能力四块:相机可控生成(少量参考图最多 1 分钟 1440p);稀疏视角三维重建(官方称两到三张即可,并输出点云 / 3D Gaussian splats);时空仿真(几部手机拍的素材做子弹时间、机器人 Real-to-Sim);文生图和 360 全景。官方自测:相机可控生成上,第三方评分者相对 MiniMax H3 选 Atlas 75%、相对 Seedance 2.5 94%;稀疏重建平均 AbsRel 25.3(次优对照 28.7)。基准均为自家设置,尚未见独立复现。Atlas 还不进现有 Marble 世界,将驱动后续 Marble;现开早期访问申请。

5. OpenAI:ChatGPT for Healthcare 接入 Epic,只读病历

OpenAI 9 月 1 日宣布,医疗机构可把 Epic 电子病历接到 ChatGPT for Healthcare,并上线 Healthcare Public Data 插件,一次连九个官方数据源(ClinicalTrials.gov、CMS Coverage、RxNorm、DailyMed、PubMed 等)。两种用法:把已授权的患者上下文拉进 ChatGPT;或在支持的部署里把 ChatGPT 嵌进病历界面。示例问题:上次就诊后改了什么、今天该看哪些化验、药有没有变。连接是 只读:不能改病历、下医嘱、给患者发消息,也不扩大原有查阅权限。UCSF Health 总裁兼 CEO Suresh Gunasekaran 作为试点伙伴表态。医生评估 27 个临床场景、4363 条评分,99.1% 判为安全;另一组针对大型美国数据集的细问题,五个数据源都有超过 93% 评为「良好」及以上。EHR 集成面向 ChatGPT for Healthcare / 启用 HIPAA 的 Enterprise 工作区,个人 Clinicians 账号用不了。Epic 系统覆盖逾 3.25 亿患者记录,这是系统规模,不是 OpenAI 已接入的数量。

6. NVIDIA:DLSS 5 今日上线,3D 引导神经渲染

NVIDIA 确认 DLSS 5 于 9 月 3 日太平洋时间 21:00 上线。核心是 3D-Guided Neural Rendering:不再只从引擎输出重建更高分辨率,而是作为管线最后一档,用一步像素空间扩散模型补皮肤次表面散射、头发透光、接触阴影等实时渲染砍掉的细节。输入是引擎帧、运动向量和艺术方向参数,官方称因果、确定、按帧稳定。首发游戏 Visual Concepts / 2K 的 《NBA 2K27》,覆盖全部 GeForce RTX 50 桌面和笔记本,以及 GeForce NOW Ultimate(云端 RTX 5080)。官方 4K Ultra + 光追数字:RTX 5090 最高约 370 fps,但这是叠了 Super Resolution 和 Multi Frame Generation 的整套 DLSS,不是神经渲染单独跑。独立测试和 PC Gamer 转述:打开神经渲染层本身可能掉 50%–60% 帧率;GameGPU 在《赛博朋克 2077》4K RTX 5090 上测到约 63 → 42 fps。RTX 40 / 30 是否支持,NVIDIA 未在发布时确认。需 9 月 3 日 Game Ready 驱动,游戏内打开「DLSS Neural Rendering」。

7. 阿里千问:Qwen3.8-Max-0902 快照

阿里千问 9 月 2 日把旗舰 Qwen3.8-Max 升到快照 0902(别名 qwen3.8-max-2026-09-02)。参数没变:MoE 2.4T 总参、约 95B 激活、1M 上下文,原生视觉。这一版针对 Coding 和 Cowork 再做后训练。官方自测相对原版:Terminal-Bench 3.0 11.3 → 29.0,DeepSWE 1.1 56.6 → 69.3,QwenSWEBench V2 55.1 → 70.0,JobBench 53.4 → 64.0。IT之家援引官方:CodeArena 前端编程总榜升 22 分到 1691 夺冠;性价比榜上每百万 Token 综合均价约 5 美元,当时二、三名约 2012 美元。QwenCloud 计价仍是输入 2、输出 6 美元 / 百万 Token。已上线千问 AI 平台 API,并接入千问办公、Qoder、千问 App。基准为官方数字。

8. Google:Gemini 视频分析改成 Agent 循环

Google DeepMind 9 月 1 日给 Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Lite 上线 agentic video understanding。以前默认按固定帧率(1 FPS,可调)把整段视频吃进去;现在模型按问题自己决定看哪一段、用多高帧率、看画面 / 音频 / 字幕哪一路,服务端工具循环按需取片段。官方基准:Token 最多少 88%,分析成本最多降 66%,精度最多升约 7%。长视频(10 分钟教程、90 分钟课、数小时录像)差得最明显。能力包括亚秒级切点检索、数小时视频里找一根针、异常检测、动作和物体计数。API 把视频 processing 设成 "agentic" 即可,按普通 Token 计价、不加价。现用于上传视频和公开 YouTube,走 Google AI Studio 的 Gemini API 和 Gemini Enterprise Agent Platform。Gemini 应用随后放开;未来几个月会进 YouTube 观看页的 Ask YouTube。

9. Google Pics:Workspace 里的 AI 生图改图

Google 9 月 1 日起向 Workspace 和企业订阅推 Google Pics。底层是 Nano Banana 图像模型,单独应用,也嵌进 Docs、Slides,Drive 随后跟上。定位日常海报、社媒图、插画:提示词生成多张变体,点选物体或文字做局部改、图内文字编辑和翻译、升到 2K / 4K、按渠道裁切,并支持协作分享。Rapid Release 域 9 月 1 日起最多 15 天滚动;Scheduled Release 从 9 月 15 日开始。可用范围:Business Standard / Plus、Enterprise Standard / Plus、Google AI Pro / Ultra、Google AI Pro for Education。入口 pics.new。媒体拿它和 Canva、Adobe Express 比:Pics 先生成再精修,没有创作者模板市场。生成功能受用量上限约束。

10. 加拿大 Tumbler Ridge 枪击案:再有 30 起诉讼指向 OpenAI

律师事务所 Edelson PC 9 月 2 日在加州北区联邦法院再提交约 30 起诉讼,原告包括事发时在校的学生、教师和校长。加上 4 月遇难者家属的 7 起,累计约 37 起。事件是 2026 年 2 月 10 日不列颠哥伦比亚省 Tumbler Ridge 校园枪击,18 岁 Jesse Van Rootselaar 被指杀害 8 人后自杀。新诉状除过失、产品责任外,首次加「帮助与教唆」大规模枪击:称 OpenAI 安全组约八个月前把该账号标成对真人的可信、具体枪暴威胁并建议报警,却被否决;账号被停用而非全站封禁,嫌疑人换邮箱又进来。诉状点名全球事务官 Chris Lehane 让员工不要报警,TechCrunch 写诉状未给出其亲自介入的直接证据,OpenAI 否认其参与。首席战略官 Jason Kwon 说公司每天都在想这件事,并在建立向执法部门报告的标准。以上均为诉状主张,法庭尚未认定。

用代码记录成长 · RSS 订阅 · 标签