跳到正文

全部动态

今日 0 条
8月20日周四
8月19日周三
  1. ComfyUI Blog78

    ComfyUI 开源本地版 Comfy MCP 服务器

    ComfyUI 正式开源其 MCP 服务器,支持在本地机器上直接运行,允许 Claude、Codex 等智能体连接本地 ComfyUI 环境。该更新实现了本地与云端的统一接入,智能体能自动读取硬件配置以评估模型兼容性,并处理权重下载、节点匹配及工作流执行等复杂设置任务。

    推荐理由:ComfyUI 将 MCP 服务器完全开源并支持本地运行,用户可通过单一智能体无缝调度本地与云端资源,显著降低本地部署门槛。

8月14日周五
  1. ComfyUI Blog80

    MiniMax 发布开源音乐生成模型 MiniMax Music 3

    MiniMax 发布了开源权重音乐生成模型 MiniMax Music 3,该模型已集成至 ComfyUI。它采用双语言模型混合连续合成架构,支持根据歌词和描述生成长达五分钟、结构完整的 32 kHz 立体声歌曲,并提供通过结构化标题对人声和编曲进行细粒度控制的能力。

    推荐理由:原文详细拆解了 MiniMax Music 3 的双 LLM 加 Flow Matching 架构,并提供了在 ComfyUI 中生成完整结构歌曲的具体工作流与参数控制方法。

  2. Google DeepMind84

    Google DeepMind 发布 Gemini 3.7 Flash:面向编码与智能体的主力模型

    Google DeepMind 发布 Gemini 3.7 Flash,这是其针对编码和智能体任务的最强主力模型。该版本在 FrontierCode 1.1 Main (43.6% vs 34.4%) 和 DeepSWE v1.1 (65.3% vs 49.0%) 等基准测试中显著优于前代,并在 GDP.pdf 和 AutomationBench 上展现更强的推理能力。

    推荐理由:新模型在代码生成和复杂文档处理上显著提升,且价格减半,适合评估其在生产环境中的成本效益。

8月12日周三
  1. Google DeepMind82

    Google DeepMind 发布 SL2T 手语翻译模型并集成至 Gboard 和 Live Transcribe

    Google DeepMind 推出大规模多语言手语转文本(SL2T)模型,首次将手语AI应用于消费级产品,支持美国手语(ASL)到英语的实时转换。该模型基于超过10万小时、涵盖50多种手语的数据训练,通过MediaPipe Holistic提取人体姿态关键点而非原始视频以保护隐私,直接输出流式文本。

    推荐理由:原文给出了SL2T模型的技术原理、隐私保护机制及在Pixel 11上的落地入口,读者可以据此判断其如何改变聋人用户的输入体验。

  2. ComfyUI Blog73

    ComfyUI 宣布支持 LTX-2.5 视频模型

    ComfyUI 正式支持最新开源视频模型 LTX-2.5,提供本地运行和 Partner Nodes 托管两种使用方式。该版本引入了基于复杂度的新渲染方法、扩散式视频解码器以及自定义 Gemma 4 12B 文本编码器,并保留了原生 4K、音视频同步及最高 50fps 帧率等特性。

    推荐理由:ComfyUI 官方同步支持 LTX-2.5,提供了开源权重与托管节点两种接入方式及关键渲染特性说明。

8月8日周六
  1. ComfyUI Blog78

    ComfyUI 原生支持 Wan Animate 2 模型

    ComfyUI 现已原生支持 Wan Animate 2 及其高效变体 Lite,提供高保真角色动画和实时流式生成能力。该模型采用端到端 Diffusion Transformer 架构直接处理驱动视频,消除了中间运动提取器以提升动作质量和身份保持度,并支持文本驱动的视角控制。

    推荐理由:ComfyUI原生支持Wan Animate 2,通过端到端架构提升动作保真度并实现实时流式动画生成。

  2. ComfyUI Blog80

    ComfyUI 通过 Partner Nodes 上线 Seedance 2.5 视频模型

    Seedance 2.5 现已通过 Partner Nodes 在 ComfyUI 中可用。该模型支持单次生成长达 30 秒的连续视频片段,并允许在一次运行中使用最多 50 个参考资产(包括图像、视频和音频)来锁定角色、环境和运动细节。

    推荐理由:原文详细说明了 Seedance 2.5 在 ComfyUI 中实现单次生成 30 秒连续视频及多模态参考资产控制的具体能力,为视频创作者提供了新的工作流选择。

8月6日周四
  1. Google DeepMind90

    Google DeepMind 开源 WeatherNext 2 与 Cyclones 模型,气旋预测精度提升相当于十年气象进步

    Google DeepMind 宣布开源 WeatherNext 2 和 WeatherNext Cyclones 模型,其 Nature 论文显示该 AI 模型在气旋路径、强度和风结构预测上达到 SOTA,平均为预报员提供额外一天的预警时间,相当于过去十年的气象技术进步。

    推荐理由:WeatherNext 在气旋预测中实现相当于十年气象进步的精度提升,并开源了模型权重与代码。

8月3日周一
  1. ComfyUI Blog82

    MiniMax H3 发布并获 ComfyUI Day-0 支持

    MiniMax 发布第三代视频模型 H3,这是其首个开放权重的视频模型,已在 ComfyUI 中实现 Day-0 原生支持。该模型支持文本、图像、视频和音频输入,能生成最高 2K 分辨率、15 秒时长的视频,并同步生成原生立体声音频。通过剪枝调制权重、int8 量化及自定义内核等技术,H3 在 ComfyUI 中的显存占用降低 66%,使得 RTX 3060 等消费级 GPU 也能进行本地推理。

    推荐理由:原文说明了 H3 的开放权重特性及在 ComfyUI 中的本地推理优化细节,读者可据此评估其在消费级硬件上的实际部署可行性。

7月30日周四
  1. Google DeepMind80

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型

    Google DeepMind 正式发布 Gemini Robotics ER 2,这是其最新的高阶“具身推理”模型,旨在通过视频理解、任务编排和多机器人协作提升机器人在物理世界中的实用性。

    推荐理由:新模型通过视频理解实现任务进度追踪与多机器人协作,并公开了API接入入口及基准测试数据。

  2. Google DeepMind57

    Google DeepMind 发布 Lyria 3.5 音乐生成模型并上线 Google Flow Music

    Google DeepMind 推出最新音乐生成模型 Lyria 3.5,并即日起在 Google Flow Music 中向用户开放。该模型在音乐性、歌词质量、人声表现和创作控制四个方面进行了升级,包括生成更复杂的旋律结构、提高提示词遵循度、增强人声情感表达以及允许用户更轻松地控制输出节奏和时长。

7月28日周二
  1. Google DeepMind84

    Google DeepMind 发布 Gemini Robotics 2 系列模型

    Google DeepMind 推出 Gemini Robotics 2 系列模型,赋予机器人全身智能控制、精细灵巧操作及多机协作能力。该系列包含用于视觉语言动作控制的 VLA 模型、作为高层大脑的 ER 推理模型以及支持快速适配新硬件的端侧模型。目前 ER 模型已在 Google AI Studio 上线,VLA 和端侧模型向早期合作伙伴开放。

    推荐理由:原文详细拆解了全身体控制、灵巧操作及多机协作的技术实现,为理解通用物理AI的落地路径提供了具体参考。

7月24日周五
7月22日周三
7月21日周二
7月17日周五
7月16日周四
7月13日周一
  1. Google DeepMind35

    Google DeepMind 推出 Gemini 驱动的 ATL Saathi 试点应用

    Google DeepMind 在印度启动 ATL Saathi 实时试点,这是一款基于 Gemini 3.5 Flash 模型的 Web 应用,旨在为 Atal Tinkering Labs 教师提供全天候规划与培训助手。该工具支持 8 种语言,利用 NotebookLM 整理课程并生成项目方案、接线图及安全指南,目前已在 100 所试点学校部署,助力将传统实验室转型为 AI 增强型发现实验室。

7月3日周五
7月1日周三
  1. Google DeepMind78

    Google DeepMind 发布 Nano Banana 2 Lite 图像模型与 Gemini Omni Flash 视频模型

    Google DeepMind 推出 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)和 Gemini Omni Flash(gemini-omni-flash-preview)两款新模型,现已在 Google AI Studio、Gemini API 和 Gemini Enterprise Agent Platform 上线。

    推荐理由:原文给出了两款新模型的定价、延迟指标及 API 接入方式,读者可据此评估其在高吞吐图像生成与视频编辑工作流中的实际成本效益。

6月25日周四
  1. Google DeepMind78

    Gemini 3.5 Flash 内置计算机操作功能

    Gemini 3.5 Flash 现已将计算机操作(computer use)作为内置工具支持,此前该能力仅存在于独立的 Gemini 2.5 模型中。开发者可通过 Gemini API 和 Gemini Enterprise Agent Platform 构建能跨浏览器、移动端和桌面环境进行感知、推理及行动的自定义智能体。

    推荐理由:原文说明了计算机操作能力从独立模型整合进主模型的变化,并给出了针对提示注入风险的安全措施与开发入口。

6月17日周三
6月16日周二
  1. Google DeepMind65

    Google DeepMind 发布 AI Control Roadmap 以保障 AI Agent 安全

    Google DeepMind 发布 AI Control Roadmap,提出针对内部 AI Agent 的纵深防御框架,将未信任的智能体视为潜在内部威胁。该方案基于 MITRE ATT&CK 构建威胁模型,通过可信 AI 监督、行为分析及分级响应机制(D1-D4/R1-R3)来应对模型能力增长带来的安全风险。

    推荐理由:原文公开了内部 AI 控制路线图及百万级智能体轨迹分析数据,为行业提供了可参考的纵深防御框架与实时监测实践。

6月11日周四
  1. Google DeepMind82

    Google DeepMind 发布 DiffusionGemma:基于扩散的开源实验性文本生成模型

    Google DeepMind 发布 DiffusionGemma,这是一个基于 Apache 2.0 许可的 26B Mixture of Experts (MoE) 实验性开源模型,通过并行生成文本块实现最高 4 倍的推理加速。

    推荐理由:原文给出了扩散模型在本地推理中的速度优势与硬件适配细节,读者可据此评估其在实时交互场景下的可用性。

6月10日周三
6月9日周二
  1. Google DeepMind84

    Google DeepMind 发布 Gemini 3.5 Live Translate 音频模型

    Google DeepMind 发布最新音频模型 Gemini 3.5 Live Translate,支持 70 多种语言的近实时语音到语音翻译。该模型能自动检测语言并生成保留说话人语调、节奏和音高的流畅译文,通过持续生成语音而非等待说完来减少停顿。

    推荐理由:原文展示了 Gemini 3.5 Live Translate 在连续流式翻译、保留语调及多端部署上的能力变化,为开发者与企业提供了实时语音交互的新方案。

  2. Google DeepMind82

    Google DeepMind 发布 Gemma 4 12B:统一无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,这是一款旨在在笔记本电脑上运行的高性能多模态模型。该模型采用统一的无编码器架构,视觉和音频输入直接流入 LLM 主干,无需传统独立编码器,从而降低延迟和内存占用。

    推荐理由:原文给出了无编码器统一架构和16GB显存本地运行门槛,读者可以据此判断其在笔记本上实现多模态智能体的可行性。

6月8日周一
  1. Google DeepMind73

    Google DeepMind发布塞拉利昂AI辅助学习影响评估研究

    Google DeepMind公布了一项在塞拉利昂进行的预注册试验结果,显示使用Gemini驱动的Guided Learning工具使学生在八周内数学成绩提升0.258个标准差,相当于1.2至1.7年的典型学习进度。

    推荐理由:原文披露了塞拉利昂预注册试验的量化结果,展示了AI作为教学伙伴而非答案引擎的实际效能与行为改变。

5月22日周五
5月19日周二
5月18日周一
  1. Google DeepMind73

    Project Genie 新增 Street View 实景锚定功能并向 Google AI Ultra 用户开放

    Google DeepMind 在 Project Genie 中推出基于 Street View 的实景锚定能力,允许用户选择美国境内的真实地点作为生成世界的起点,并应用如“海洋世界”或“黑白电影”等风格进行创意重构。

    推荐理由:Project Genie 接入 Street View 真实影像,让 AI 生成的虚拟世界能锚定现实地点,为智能体提供更具真实感的交互环境。

  2. Google DeepMind91

    Google DeepMind 发布 Gemini Omni Flash 模型

    Google DeepMind 推出 Gemini Omni 系列首个模型 Gemini Omni Flash,支持从图像、音频、视频和文本输入生成高质量视频,并允许通过自然语言进行多轮对话式编辑。

    推荐理由:原文展示了 Gemini Omni Flash 在视频生成与对话式编辑上的能力,并明确了其在多个 Google 产品中的落地入口。

5月17日周日