Omni1.1视频升级
谷歌发布Gemini Omni 1.1 Flash,支持按10秒延展视频至40秒、指定首尾帧、360p草稿和4K放大。模型开始通过Gemini API、AI Studio及企业平台提供。
AI DAILY · 2026 / 08
大模型、算法、训练与推理能力更新
谷歌发布Gemini Omni 1.1 Flash,支持按10秒延展视频至40秒、指定首尾帧、360p草稿和4K放大。模型开始通过Gemini API、AI Studio及企业平台提供。
面向用户与行业的AI产品和应用
谷歌AI Mode新增酒店直接预订,先在美国英语用户中推出,可使用Google Pay付款;同时扩展航班价格提醒及积分、里程价格比较,减少旅行规划中的页面切换。
开源项目、开发框架、工具与API
面向求职者的本地AI工作流,串联职位评估、简历与求职信定制、PDF和ATS检查及面试准备,申请仍由用户决定和发送。近期补充PDF提取并修复参数校验,完整求职流程与本地资料管理是其受关注的特点。
为开发者和团队提供统一模型接口,支持多供应商路由、额度感知回退、预算监控以及MCP和A2A集成,可连接Claude Code、Codex等工具。近期更新轮换超时测试与界面细节,适合管理多模型工具链的可用性和费用。
面向企业知识库和AI应用开发者,将文档解析、分块、混合检索、重排及引用溯源组成RAG引擎,并提供智能体工作流。近期修复向量分数提取和生成状态处理;文档知识接入与可追溯回答是其主要使用场景。
基于LangGraph提供规划、文件操作、上下文压缩、持久记忆、子智能体和人工介入能力,帮助开发者构建持续执行多步骤任务的智能体。近期完善Python运行时扩展并修复递归限制问题,适合需要状态管理和任务拆解的应用。
GitHub官方MCP服务让AI工具在授权范围内访问仓库、代码、议题、拉取请求和工作流,可远程连接或本地部署。近期补充Copilot审查讨论的解决原因,适合把代码检索、评审和协作操作纳入智能体流程。
云服务、数据中心和AI基础设施
Amazon Bedrock为GPT-5.6 Terra和Luna推出印度跨区域推理,可在孟买与海得拉巴区域间调度请求,使推理与数据处理保持在印度境内,兼顾容量弹性和数据驻留需求。
AWS、英伟达与Heidi披露语音识别技术实测:利用CUDA MPS和Triton并行调度,将所需GPU实例从16个减至4个并维持亚秒级延迟。75%的降幅针对该案例负载,不是普遍保证。
Deepgram为SageMaker AI自托管语音模型提供增强指标,将按模型和传输方式统计的用量、计费数据接入CloudWatch,并结合运行监控帮助企业定位成本与性能问题。
论文、技术报告和研究成果
OpenAI介绍博科尼大学逾千名新生参与的随机实验:在特定商业作业中,ChatGPT改善方案质量与连贯性,因果推理训练增加想法差异性,两者结合各有作用;结果不代表所有学习场景。
Salesforce公布覆盖20国2025名决策者的调查:已部署智能体的受访企业自报约8个月获得有意义回报。数据质量、场景边界和人工升级路径与成效相关;结果属自报调查,不能视作收益保证。
政策法规、标准、治理与安全
Google DeepMind与新加坡AI安全研究所等伙伴试点双盲模型评估:借助加密执行环境,评估方不接触模型权重,开发方看不到私有测试提示,减少测试污染并保护敏感数据。
GitHub开始分批执行Copilot全局模型策略,未单独配置的正式模型将继承默认设置,已有显式选择保留。开权重模型和需保留数据的模型不默认启用,推广将持续至9月1日。
组织变动、合作及产业进展
谷歌与可汗学院将Gemini驱动的交互图示和练习生成工具带入新学期课堂。学生可调整图示理解概念,教师可根据教学材料生成、编辑和审核练习后再发给学生。
OpenAI在圣保罗建立团队并启动巴西商业运营,面向当地企业、开发者和研究机构拓展合作。公司称巴西企业版席位同比增至五倍,并通过Prodam与圣保罗市签署合作备忘录。
Salesforce披露内部Employee Agent一年处理逾30万次对话,自报97.7%会话以员工自助解决结束;系统接入Slack并提供人事问答、会议安排等能力,公司同时总结了知识库清理与权限治理经验。
智元公布第二届世界人形机器人运动会成绩:获18金16银12铜,共46枚奖牌;参赛机型均为量产产品,覆盖灵巧操作、工作任务等项目,展示触觉感知和具身模型在竞赛任务中的应用。