跳到正文

全部动态

今日 0 条
9月10日周四
  1. OpenAI62

    OpenAI 在 API 中推出 GPT-Live-1 以构建更自然的语音体验

    OpenAI 在 API 中推出 GPT-Live-1,为开发者提供自然的全双工语音对话能力。该模型具备更强的指令遵循能力,并支持自定义声音和电话通信功能。

    推荐理由:原文说明了GPT-Live-1在API中支持全双工对话、自定义声音和电话功能,开发者可据此评估其在实时语音交互场景中的适用性。

  2. OpenAI62

    OpenAI 推出 Agents API

    OpenAI 发布 Agents API,旨在帮助开发者在云端构建和部署智能体。该接口提供了一套用于编排多步任务、工具调用及状态管理的标准化组件。

    推荐理由:原文介绍了面向智能体构建的新 API,开发者可据此评估其在现有工作流中的集成潜力。

  3. Google AI40

    Google DeepMind 用 AI 重现 Burt 和 Ethelle 70 年爱情故事

    Google DeepMind 与导演 Liz Garbus 合作,利用生成式模型修复黑白照片并捕捉人物微表情,在短片《Love, Rendered》中重现了结婚 70 年的 Burt 和 Ethelle 未留影像的初遇记忆。该工作流结合图像恢复与姿态控制,将老年特征映射至年轻形象,旨在通过技术辅助认知衰退患者保留珍贵情感连接。

9月9日周三
9月8日周二
  1. Google DeepMind78

    Google DeepMind 发布 AlphaGenome Atlas:人类基因组 DNA 变异预测平台

    Google DeepMind 推出 AlphaGenome Atlas,这是一个包含人类基因组中 90 亿个单核苷酸变异预测的平台。该工具提供 AVI 评分以快速排序变异影响,并支持通过网站、API 和 Google Antigravity 技能访问。外部合作者已利用其识别罕见病关键变异并发现与常见性状相关的稀有变异。

    推荐理由:原文提供了覆盖全基因组的变异预测平台及评分工具,读者可据此评估其在罕见病研究和群体遗传学中的实际效用。

9月7日周一
9月6日周日
9月5日周六
  1. ComfyUI Blog18

    Comfy 推出 Forward Deployed Creatives 服务

    Comfy 推出 Forward Deployed Creatives 服务,由专家嵌入企业团队构建并交付可自主维护的 AI 工作流。该服务通过验证、构建、赋能和移交四阶段,解决原型难以规模化及生产就绪问题。核心目标是实现团队对流程的完全所有权,避免工具因人员变动而失效。

9月4日周五
9月3日周四
  1. Google DeepMind82

    Google DeepMind 发布 WeatherNext 3 全球天气 AI 模型

    Google DeepMind 和 Google Research 推出 WeatherNext 3,这是其最新且最准确的全球天气 AI 模型。该模型直接学习实时卫星观测数据,提供每小时更新的高分辨率预报,地表变量分辨率达 5 公里,较上一代提升约五倍。

    推荐理由:原文详述了模型在分辨率、实时数据接入及降水预测上的具体提升,并说明了其在 Google 生态中的集成方式。

  2. Google DeepMind65

    Google DeepMind 推出 Fairwind Program 提供政府与企业主动网络防御能力

    Google DeepMind 启动 Fairwind Program,向政府和可信合作伙伴开放基于 Gemini 3.8 Flash Cyber 和 CodeMender 的高级网络防御能力。该计划旨在帮助防御者以代理规模自主发现、验证并修复漏洞,将补丁生成时间从数周缩短至几分钟。目前已有超过 650 家全球合作伙伴参与,重点保护公共部门网络、关键基础设施及核心技术平台。

    推荐理由:原文披露了 Fairwind Program 的准入机制与核心组件,读者可据此评估其在关键基础设施防御中的实际部署价值。

9月2日周三
  1. Google AI68

    Google 启动 Fairwind 计划,向政府与企业开放高级 AI 网络防御能力

    Google 推出 Fairwind 计划,向政府、关键基础设施运营商及可信合作伙伴提供受限访问权限,利用其最先进的人工智能进行主动网络防御。该计划整合了 Gemini 3.8 Flash Cyber 模型与 CodeMender 框架,使防御者能够在安全的云环境中以代理规模自主发现、验证并修复代码漏洞,将原本需数周的手动修复过程缩短至几分钟。

    推荐理由:原文披露了面向政府与企业的受限访问计划,结合 Gemini 3.8 Flash Cyber 与 CodeMender 实现漏洞自动修复,展示了 AI 在主动网络防御中的具体落地路径。

  2. Google AI63

    Google 推出 Google Pics:集成于 Workspace 的 AI 图像创建与编辑工具

    Google 推出 Google Pics,这是一款基于 Nano Banana 模型构建的图像创建和编辑工具,正在向 Google AI Pro、Ultra 订阅用户及大多数 Workspace 商业客户逐步开放。

    推荐理由:原文说明了基于 Nano Banana 模型的图片编辑能力以及直接嵌入 Workspace 应用的工作流变化,读者可据此评估其对现有设计协作流程的影响。

9月1日周二
  1. ComfyUI Blog80

    ComfyUI 原生支持 Trellis.2 和 Pixal3D 模型

    ComfyUI 宣布原生集成 Trellis.2 和 Pixal3D 两个开源 3D 生成模型,无需自定义节点或编译 CUDA 扩展即可运行。此次更新重构了 3D 工作流,新增 Load/Preview/Save 3D 节点及网格后处理功能,并移除了非商业许可依赖,支持在消费级硬件上免费进行包括商业用途在内的资产生成。

    推荐理由:原生集成消除了编译依赖和许可限制,并配套完整的3D后处理节点,降低了本地高质量3D生成的门槛。

8月28日周五
  1. ComfyUI Blog68

    ComfyUI 上线 Gemini Omni 1.1 Flash:支持快速视频生成、编辑及 4K 输出

    ComfyUI 通过 Partner Nodes 正式接入 Google 的 Gemini Omni 1.1 Flash 模型。该节点在单个界面中提供文本转视频、图像转视频、参考图转视频、视频编辑和场景扩展功能,支持 360p 至 4K 分辨率输出,并为每个片段自动生成音频轨道。

    推荐理由:ComfyUI 集成 Gemini Omni 1.1 Flash,支持从文本到视频及指令式编辑,最高输出 4K 分辨率并自动生成音频。

8月27日周四
  1. Google DeepMind63

    Google DeepMind 试点全球首个双盲 AI 评估

    Google DeepMind 宣布推出全球首个针对专有前沿 AI 模型的双盲评估机制,旨在通过加密“盒子”隔离外部评估数据,防止模型在测试前接触题目导致的基准污染。该方案与 Singapore AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作,目前已在 Gemini Flash Lite 模型上进行测试。

    推荐理由:原文介绍了利用加密环境防止基准污染的双盲评估方法,为验证前沿模型真实能力提供了新的技术路径。

  2. Google DeepMind78

    Google DeepMind 发布 Gemini 3.5 Transcribe 语音转文字模型

    Google DeepMind 发布最新语音转文字模型 Gemini 3.5 Transcribe,旨在实现精准且智能的实时转录。该模型在 Artificial Analysis 测试中流式和非流式平均词错率分别为 4.0% 和 2.6%,支持超过 85 种语言及最多三个说话人的身份识别。

    推荐理由:原文给出了新模型的流式与非流式词错率数据、多语言支持范围以及开发者 API 接入方式,读者可以据此评估其在实时交互场景中的实际表现。

8月26日周三
8月25日周二
  1. ComfyUI Blog78

    ComfyUI 原生支持 Wan 3.0:实现 30 秒视频生成与全能参考控制

    ComfyUI 现已原生支持阿里巴巴最新视频生成模型 Wan 3.0。该版本支持单次生成最长 30 秒的视频,无需拼接,并允许通过 @ 语法引用最多 10 张图片、5 个视频和 5 个音频片段作为参考素材。Wan 3.0 还新增了网页文档解析输入、480p 低成本档位以及基于指令的精准视频编辑功能,用户需将 ComfyUI 更新至 v0.33.4 或通过 Comfy Cloud 使用。

    推荐理由:ComfyUI 原生支持 Wan 3.0,提供 30 秒长视频生成及多模态参考控制能力。

8月21日周五