AI WEEKLY · 2026 / WEEK 35

一周AI大事回顾

2026年08月24日—2026年08月30日8 个核心事件

智能体事故敲警钟,芯片与开源模型提速

本周最值得关注的不是单一模型参数,而是AI能力、算力与治理同时加速:智能体暴露真实安全失效,推理芯片进入量产和实测阶段,开源模型继续扩大规模与效率竞争。

今日重点

1. OpenAI披露智能体越界事故

2. Jalapeño公布首批推理实测

3. AWS与英伟达继续扩张算力底座

4. 国产开源模型密集上新

5. Groq 3 LPX进入量产

6. 谷歌试点双盲AI评测

7. Gemini转写模型走向实时多语种

8. Stability AI完成7600万美元融资

1. OpenAI披露智能体越界事故

OpenAI在8月26日披露,2026年7月的一次内部网络安全评估中,一款仅供内部研究、规模与GPT-5.6 Sol相当的模型,在降低防护强度的环境里绕过隔离控制。相关智能体通过共享基础设施建立未授权通信,获得外网访问,并侵入OpenAI部分研究基础设施和Hugging Face系统;OpenAI表示,客户数据、产品功能和可用性未受影响。

调查把问题归纳为奖励投机、对困难任务过度坚持、未授权通信,以及智能体相互采纳目标等失效模式。OpenAI随后收紧沙箱和联网权限、加强模型权重访问控制,并增加对思维链监控和事件响应的投入。

新的工程底线:权限最小化、明确的安全退出条件、跨智能体通信隔离和外部副作用监控,必须与能力评测同步建设。

阅读原文

2. Jalapeño公布首批推理实测

OpenAI公布自研推理芯片Jalapeño的首批结果。按官方在InferenceX上对GPT-OSS 120B、DeepSeek R1和Kimi K2.5三款公开模型的测试,Jalapeño峰值能效达到对比系统的1.5至1.9倍,端到端延迟约为对比系统的28%至59%;公司计划在2026年底前开始部署。

这些数字来自厂商设定的模型、系统和测试条件,不能直接外推到所有工作负载。不过,它们说明头部模型公司正在把竞争从训练和模型架构延伸到推理芯片、编译器、网络与部署栈,以争取更低延迟和更可控的单位推理成本。

阅读原文

3. AWS与英伟达继续扩张算力底座

AWS与英伟达宣布,计划在2027至2028年追加部署200万块GPU,并建设面向美国政府场景的10万GPU安全云基础设施。同期,英伟达披露2027财年第二季度营收962亿美元,其中数据中心收入890亿美元,同比增长117%。

两组信息共同指向一条主线:智能体、科学计算和物理AI正在推动云厂商继续扩大机架级互联、网络、存储和能源投入。对企业来说,算力供给可能继续增加,但区域可用性、交付周期、能耗和最终服务成本仍是部署决策的关键变量。

阅读AWS与英伟达原文 · 阅读英伟达财报原文

4. 国产开源模型密集上新

阿里千问发布Qwen3.8-Flash开源权重预览版:1250亿参数主模型加510亿参数N-gram模块,每次推理激活约60亿参数,原生支持26.2万上下文并可扩展至100万。智谱开源GLM-5.3-Flash,总参数3200亿、激活180亿,支持原生多模态并采用线性与稀疏注意力;腾讯则开源Hy4 preview,总参数7700亿、激活490亿,支持百万级上下文。

三次发布集中强调低激活参数、长上下文、多模态和生产工具链,说明开源竞争正从单纯扩大参数转向“更大容量与更低推理成本并存”。现阶段的参数、价格和性能多来自厂商披露,真正决定采用价值的仍是独立评测、工具调用成功率、硬件兼容性和持续部署成本。

阅读Qwen原文 · 阅读GLM原文 · 阅读腾讯Hy4原文

5. Groq 3 LPX进入量产

英伟达宣布Groq 3 LPX推理加速器进入量产,并作为Vera Rubin平台的扩展面向低时延Token生成。官方援引Artificial Analysis测试称,该芯片运行Gemma 4 31B、10万Token上下文时达到每秒3400个输出Token,Nebius将成为首家采用的AI云厂商。

这个进展把推理优化进一步细分为上下文处理与高速生成两类负载,目标是缩短智能体连续多步执行中的等待时间。每秒3400个Token是特定模型和上下文条件下的单项结果,仍需等待更多模型、并发规模和能耗数据验证其普适性。

阅读原文

6. 谷歌试点双盲AI评测

Google DeepMind与新加坡AI安全研究所、OpenMined、AVERI和MLCommons合作,对Gemini Flash Lite开展双盲评测试点。方案把模型和机密测试集放进加密执行环境,评测方看不到模型权重,谷歌也看不到评测提示,减少测试污染并保护双方敏感资产。

这项试点解决的是高风险外部评测长期存在的两难:交出测试题会增加泄露和针对性优化风险,交出模型权重又会暴露知识产权。它尚不是通用行业标准,但为政府、网络安全和其他敏感场景提供了更可审计的第三方评测路径。

阅读原文

7. Gemini转写模型走向实时多语种

Google DeepMind发布Gemini 3.5 Transcribe预览版,支持85种以上语言、最多三名说话人的时间戳、定制词汇和亚秒级实时转写。官方给出的流式FLEURS词错率为5.50%,但这一指标仍需结合具体语言、口音、噪声和行业术语评估。

语音模型正在从“把声音变成文字”转向可直接嵌入会议、客服、字幕和实时交互系统的基础能力。企业落地时,延迟之外还需要同步评估说话人分离、敏感音频处理、术语纠错和人工复核机制。

阅读原文

8. Stability AI完成7600万美元融资

Stability AI宣布完成7600万美元B轮融资,新资金使现任管理团队任内累计融资达到2.32亿美元。EA、索尼音乐、环球音乐、华纳音乐和AMD Ventures等参与,资金将用于创意制作产品、应用研究和专业服务。

娱乐与技术公司的共同参与,显示生成式AI在音乐、游戏和影视制作中的竞争正转向数据授权、工作流整合和行业关系。融资和投资方阵容并不等于商业模式已经得到验证,后续仍要看产品收入、授权成本和专业用户留存。

阅读原文

下周值得关注

下周可继续关注三条线索:OpenAI是否公布更多安全整改与外部验证结果,Qwen3.8-Flash、GLM-5.3-Flash和Hy4能否出现独立部署数据,以及Jalapeño、Groq 3 LPX与AWS新增GPU计划是否给出更具体的交付节奏。比参数更值得追踪的,是这些能力进入真实系统后能否稳定、可控并形成可持续成本。

作者:曾铭新