OpenAI 在 ChatGPT Work 中推出 Data agent
OpenAI 在 ChatGPT Work 中推出 Data agent,允许用户通过自然语言连接公司数据、挖掘洞察并构建交互式仪表板。该功能旨在让所有人利用 AI 将数据转化为实际价值,简化数据分析与可视化流程。
OpenAI 在 ChatGPT Work 中推出 Data agent,允许用户通过自然语言连接公司数据、挖掘洞察并构建交互式仪表板。该功能旨在让所有人利用 AI 将数据转化为实际价值,简化数据分析与可视化流程。
OpenAI 正式推出专为金融服务设计的 ChatGPT 版本,旨在帮助分析师完成从研究到客户演示的全流程工作。该工具集成了数据检索、财务建模及文档生成能力,支持用户快速构建估值模型并输出符合行业标准的报告。
OpenAI 与 GSA 联合宣布,向符合条件的联邦、州、地方及部落政府提供 $0 许可费、50% 使用折扣及扩展的网络防御支持。该举措旨在降低公共部门获取先进 AI 技术的门槛,同时强化其网络安全防护能力。
OpenAI 在 API 中推出 GPT-Live-1,为开发者提供自然的全双工语音对话能力。该模型具备更强的指令遵循能力,并支持自定义声音和电话通信功能。
推荐理由:原文说明了GPT-Live-1在API中支持全双工对话、自定义声音和电话功能,开发者可据此评估其在实时语音交互场景中的适用性。
OpenAI 发布 Agents API,旨在帮助开发者在云端构建和部署智能体。该接口提供了一套用于编排多步任务、工具调用及状态管理的标准化组件。
推荐理由:原文介绍了面向智能体构建的新 API,开发者可据此评估其在现有工作流中的集成潜力。
Paul Christiano 加入 OpenAI Foundation Board 及其安全与保障委员会。他将凭借在 AI 对齐、安全和标准方面的经验参与工作。
Google Search 推出 Live Game Feed,提供实时比赛回顾、AI 洞察及视频集锦。用户可通过 AI Mode 连接 Yahoo Fantasy 或 Sleeper 账户,获取基于阵容的定制建议。该功能目前在美国移动端以英语提供,后续将扩展至大学球队及全球更多地区。
Google DeepMind 与导演 Liz Garbus 合作,利用生成式模型修复黑白照片并捕捉人物微表情,在短片《Love, Rendered》中重现了结婚 70 年的 Burt 和 Ethelle 未留影像的初遇记忆。该工作流结合图像恢复与姿态控制,将老年特征映射至年轻形象,旨在通过技术辅助认知衰退患者保留珍贵情感连接。
OpenAI 的 Chris Lehane 指出,随着 AI 能力增强,必须同步强化安全证据、共享标准及持久的政策行动。他强调当前政策窗口正在开放,各方需立即采取行动以应对这一紧迫需求。
OpenAI 发布了新的 AI 模型。当前材料未提供具体的模型名称、版本号或详细能力参数。
MIT 研究人员利用 GPT-5.6 Sol 结合 Codex,自主运行量子计算实验、分析结果并校准量子比特。该工作流展示了大模型在复杂科学实验自动化中的实际应用潜力。
Google DeepMind 推出 AlphaGenome Atlas,这是一个包含人类基因组中 90 亿个单核苷酸变异预测的平台。该工具提供 AVI 评分以快速排序变异影响,并支持通过网站、API 和 Google Antigravity 技能访问。外部合作者已利用其识别罕见病关键变异并发现与常见性状相关的稀有变异。
推荐理由:原文提供了覆盖全基因组的变异预测平台及评分工具,读者可据此评估其在罕见病研究和群体遗传学中的实际效用。
OpenAI 指出更强大且实惠的 AI 能拓展个人与企业可完成的工作范围。这种技术变革旨在使业务增长变得更加经济高效。
OpenAI 发布 ChatGPT Images 2.5,旨在将用户的想法、草图和参考照片转化为更具个性化和精致感的图像。该功能致力于生成更能准确反映用户意图的图片,提升创意表达效果。
OpenAI 正在扩大对新闻业的支持力度。该计划面向学生、教育工作者、记者及新闻机构,提供工具、培训和合作伙伴关系。
OpenAI 分享了针对 Navier–Stokes 千禧年难题的 AI 生成解决方案。该方案包含一份说明文档以及使用 Lean 编写的形式化证明。
OpenAI 启动一项总额 500 万美元的资助计划,旨在支持关于生成式 AI 如何影响青少年发展、福祉及安全的独立研究。该计划面向相关领域的研究人员开放申请,鼓励对 AI 技术社会影响的深入探索。
1Password 工程师利用 Codex 快速构建新功能及内部工具,使工程生产力提升 21%。该方案在确保代码达到生产就绪状态的同时,严格维持了高安全策略标准。
OpenAI 携手 AIRPPU 和 WAN-IFRA 推出人工智能项目,旨在协助乌克兰新闻机构。该计划聚焦于增强媒体创新能力、韧性及独立新闻报道水平。
OpenAI 的 Jakub Pachocki 在《An Alien Mind》中反思日益强大的 AI 带来的对齐挑战。他呼吁加强安全措施并推动国际协调,以应对模型能力增长引发的风险。
OpenAI 披露内部编码智能体正在重塑 AI 研究,提供关于智能体使用、实验速度及任务复杂性的早期数据。这些工具通过提升实验迭代效率,显著加速了前沿模型的研发进程。
Comfy 推出 Forward Deployed Creatives 服务,由专家嵌入企业团队构建并交付可自主维护的 AI 工作流。该服务通过验证、构建、赋能和移交四阶段,解决原型难以规模化及生产就绪问题。核心目标是实现团队对流程的完全所有权,避免工具因人员变动而失效。
ComfyUI 与 MiniMax 联合举办的 H3 同步声音挑战赛揭晓结果,要求音视频在单次生成中同步输出。Visual Frisson 凭借“Spin Cycle”获最佳整体奖,toki、SonderSaid 和 Jay Choi 分别斩获最佳创意、最佳技术及 MCP 构建特别奖。
Google DeepMind 和 Google Research 推出 WeatherNext 3,这是其最新且最准确的全球天气 AI 模型。该模型直接学习实时卫星观测数据,提供每小时更新的高分辨率预报,地表变量分辨率达 5 公里,较上一代提升约五倍。
推荐理由:原文详述了模型在分辨率、实时数据接入及降水预测上的具体提升,并说明了其在 Google 生态中的集成方式。
Google DeepMind 启动 Fairwind Program,向政府和可信合作伙伴开放基于 Gemini 3.8 Flash Cyber 和 CodeMender 的高级网络防御能力。该计划旨在帮助防御者以代理规模自主发现、验证并修复漏洞,将补丁生成时间从数周缩短至几分钟。目前已有超过 650 家全球合作伙伴参与,重点保护公共部门网络、关键基础设施及核心技术平台。
推荐理由:原文披露了 Fairwind Program 的准入机制与核心组件,读者可据此评估其在关键基础设施防御中的实际部署价值。
Google DeepMind 推出 Gemini 3.8 Flash 和 3.8 Flash Cyber 两款新模型,旨在提升智能体工作流与网络安全能力。
推荐理由:原文展示了新模型在长周期编码和网络安全领域的具体性能提升及成本优势,为评估其在复杂工作流中的实际价值提供了直接依据。
Google 推出 Fairwind 计划,向政府、关键基础设施运营商及可信合作伙伴提供受限访问权限,利用其最先进的人工智能进行主动网络防御。该计划整合了 Gemini 3.8 Flash Cyber 模型与 CodeMender 框架,使防御者能够在安全的云环境中以代理规模自主发现、验证并修复代码漏洞,将原本需数周的手动修复过程缩短至几分钟。
推荐理由:原文披露了面向政府与企业的受限访问计划,结合 Gemini 3.8 Flash Cyber 与 CodeMender 实现漏洞自动修复,展示了 AI 在主动网络防御中的具体落地路径。
Google 推出 Gemini 3.7 Flash,作为面向编码与智能体的主力模型,其每百万 token 价格仅为前代一半。同时发布搭载 Tensor G6 芯片的 Pixel 11 系列设备,并上线 Gemini 3.5 Transcribe 语音转文字模型。此外,Gemini 应用月活跃用户突破 10 亿,成为 Google 历史上增长最快的产品。
Google DeepMind 宣布在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 模型中推出智能体视频理解(agentic video understanding)功能。
推荐理由:原文给出了视频分析中 token 消耗降低 88% 的具体数据及 API 调用方式,读者可据此评估其在长视频处理场景下的成本效益与落地可行性。
Google 推出 Google Pics,这是一款基于 Nano Banana 模型构建的图像创建和编辑工具,正在向 Google AI Pro、Ultra 订阅用户及大多数 Workspace 商业客户逐步开放。
推荐理由:原文说明了基于 Nano Banana 模型的图片编辑能力以及直接嵌入 Workspace 应用的工作流变化,读者可据此评估其对现有设计协作流程的影响。
ComfyUI 宣布原生集成 Trellis.2 和 Pixal3D 两个开源 3D 生成模型,无需自定义节点或编译 CUDA 扩展即可运行。此次更新重构了 3D 工作流,新增 Load/Preview/Save 3D 节点及网格后处理功能,并移除了非商业许可依赖,支持在消费级硬件上免费进行包括商业用途在内的资产生成。
推荐理由:原生集成消除了编译依赖和许可限制,并配套完整的3D后处理节点,降低了本地高质量3D生成的门槛。
ComfyUI 通过 Partner Nodes 正式接入 Google 的 Gemini Omni 1.1 Flash 模型。该节点在单个界面中提供文本转视频、图像转视频、参考图转视频、视频编辑和场景扩展功能,支持 360p 至 4K 分辨率输出,并为每个片段自动生成音频轨道。
推荐理由:ComfyUI 集成 Gemini Omni 1.1 Flash,支持从文本到视频及指令式编辑,最高输出 4K 分辨率并自动生成音频。
Comfy 宣布成为 MiniMax H3 商业许可证的首个官方经销商,支持本地商用。该许可涵盖视频、音频及音乐模型,允许 LoRA 训练与微调,并包含 Forward Deployed Creatives 专家服务。用户可通过 Comfy 获取专业版或企业版计划,实现从开源权重到合规商用的无缝衔接。
Google DeepMind 推出 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 中提供新的创意控制和生成式视频功能。
推荐理由:原文详细列出了场景延长、首尾帧插值及4K升频等具体参数与API调用方式,为开发者提供了可直接落地的生成式视频工作流优化方案。
Google Search AI Mode 升级,支持在对话中追踪超300家航司的机票价格、查询航班与酒店的积分或里程成本,并实现酒店直接预订。该功能已在180多个国家上线,初期支持Alaska Airlines、Hilton等合作伙伴,美国用户可通过Google Pay完成安全预订。
Google DeepMind 宣布推出全球首个针对专有前沿 AI 模型的双盲评估机制,旨在通过加密“盒子”隔离外部评估数据,防止模型在测试前接触题目导致的基准污染。该方案与 Singapore AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作,目前已在 Gemini Flash Lite 模型上进行测试。
推荐理由:原文介绍了利用加密环境防止基准污染的双盲评估方法,为验证前沿模型真实能力提供了新的技术路径。
Google DeepMind 发布最新语音转文字模型 Gemini 3.5 Transcribe,旨在实现精准且智能的实时转录。该模型在 Artificial Analysis 测试中流式和非流式平均词错率分别为 4.0% 和 2.6%,支持超过 85 种语言及最多三个说话人的身份识别。
推荐理由:原文给出了新模型的流式与非流式词错率数据、多语言支持范围以及开发者 API 接入方式,读者可以据此评估其在实时交互场景中的实际表现。
Google Search 提供五种工具助力家居装饰,包括利用 AI Mode 可视化家具摆放、通过 Lens 识别并购买复古单品。用户还可借助 Circle to Search 追踪灵感、使用 Search Live 指导 DIY 安装,以及查看价格历史以优化购物决策。
ComfyUI 现已原生支持阿里巴巴最新视频生成模型 Wan 3.0。该版本支持单次生成最长 30 秒的视频,无需拼接,并允许通过 @ 语法引用最多 10 张图片、5 个视频和 5 个音频片段作为参考素材。Wan 3.0 还新增了网页文档解析输入、480p 低成本档位以及基于指令的精准视频编辑功能,用户需将 ComfyUI 更新至 v0.33.4 或通过 Comfy Cloud 使用。
推荐理由:ComfyUI 原生支持 Wan 3.0,提供 30 秒长视频生成及多模态参考控制能力。
Google DeepMind 发布文章回顾从 Atari 到 EVE Online 的 15 年游戏 AI 研究历程,并宣布与 Fenris Creations 建立新的研究合作伙伴关系。其通用智能体 SIMA 2 由 Gemini 驱动,能在 No Man's Sky 等游戏中实现类人交互,无需修改游戏代码即可支持实时推理与对话。