跳到正文

#模型发布

今日 0 条
10月3日周六
10月1日周四
  1. Google DeepMind93

    Google DeepMind 发布 Gemini 4 Argon:面向复杂工作流的前沿智能模型

    Google DeepMind 宣布推出新前沿模型 Gemini 4 Argon,该模型旨在通过深度推理支持复杂的长周期工作流,目前正通过 Fairwind Program 向受信任的网络安全防御者逐步开放。

    推荐理由:原文披露了 Gemini 4 Argon 在长上下文输出、软件工程及网络安全防御上的具体基准数据与分阶段开放策略,为评估前沿模型在复杂工作流中的实际效能提供了关键参考。

9月29日周二
9月23日周三
  1. Google DeepMind78

    Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Flash-Lite TTS

    Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持从自然语言提示生成自定义角色声音并逐行指导场景对话。

    推荐理由:原文给出了两款新 TTS 模型的详细能力边界、基准排名及开放入口,读者可据此评估其在创意配音与规模化部署中的实际可用性。

9月20日周日
  1. ComfyUI Blog72

    Qwen-Image-2.1 开源发布:ComfyUI 原生支持带透明通道的图像生成与编辑

    阿里巴巴 Qwen 团队发布开源图像模型 Qwen-Image-2.1,已在 ComfyUI 中实现原生支持。该模型拥有 7B 参数,基于 MMDiT 架构,核心特性包括生成包含 Alpha 通道的 RGBA 图像、原生 2048×2048 分辨率输出以及支持最多 10 张参考图像的编辑能力。

    推荐理由:该模型在7B参数下原生支持RGBA输出和2K分辨率,无需额外背景移除节点即可直接合成素材。

9月16日周三
  1. NVIDIA36

    曼彻斯特大学利用 NVIDIA Earth-2 预测英国空气污染

    曼彻斯特大学团队利用 NVIDIA Earth-2 CorrDiff 模型,在 Isambard-AI 超算上仅用两天训练出覆盖全英、分辨率达 2-3 平方公里的空气污染预测模型。该工作流支持在 DGX Spark 桌面 AI 系统上进行推理与再训练,大幅降低算力门槛。团队计划开源数据与工作流,并探索结合边缘设备实现实时决策及智能体交互应用。

  2. Google DeepMind86

    Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 模型

    Google DeepMind 推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款新模型,旨在提升近实时推理能力以支持更复杂的语音交互任务。

    推荐理由:原文披露了 Gemini 3.8 Live 系列在实时推理、多语言切换及后台工具调用上的具体能力升级与基准表现,为构建生产级语音智能体提供了明确的技术参考。

9月12日周六
9月10日周四
  1. OpenAI62

    OpenAI 在 API 中推出 GPT-Live-1 以构建更自然的语音体验

    OpenAI 在 API 中推出 GPT-Live-1,为开发者提供自然的全双工语音对话能力。该模型具备更强的指令遵循能力,并支持自定义声音和电话通信功能。

    推荐理由:原文说明了GPT-Live-1在API中支持全双工对话、自定义声音和电话功能,开发者可据此评估其在实时语音交互场景中的适用性。

9月9日周三
9月8日周二
9月3日周四
  1. Google DeepMind82

    Google DeepMind 发布 WeatherNext 3 全球天气 AI 模型

    Google DeepMind 和 Google Research 推出 WeatherNext 3,这是其最新且最准确的全球天气 AI 模型。该模型直接学习实时卫星观测数据,提供每小时更新的高分辨率预报,地表变量分辨率达 5 公里,较上一代提升约五倍。

    推荐理由:原文详述了模型在分辨率、实时数据接入及降水预测上的具体提升,并说明了其在 Google 生态中的集成方式。

8月28日周五
8月27日周四
  1. Google DeepMind78

    Google DeepMind 发布 Gemini 3.5 Transcribe 语音转文字模型

    Google DeepMind 发布最新语音转文字模型 Gemini 3.5 Transcribe,旨在实现精准且智能的实时转录。该模型在 Artificial Analysis 测试中流式和非流式平均词错率分别为 4.0% 和 2.6%,支持超过 85 种语言及最多三个说话人的身份识别。

    推荐理由:原文给出了新模型的流式与非流式词错率数据、多语言支持范围以及开发者 API 接入方式,读者可以据此评估其在实时交互场景中的实际表现。

8月21日周五
8月14日周五
  1. ComfyUI Blog80

    MiniMax 发布开源音乐生成模型 MiniMax Music 3

    MiniMax 发布了开源权重音乐生成模型 MiniMax Music 3,该模型已集成至 ComfyUI。它采用双语言模型混合连续合成架构,支持根据歌词和描述生成长达五分钟、结构完整的 32 kHz 立体声歌曲,并提供通过结构化标题对人声和编曲进行细粒度控制的能力。

    推荐理由:原文详细拆解了 MiniMax Music 3 的双 LLM 加 Flow Matching 架构,并提供了在 ComfyUI 中生成完整结构歌曲的具体工作流与参数控制方法。

  2. Google DeepMind84

    Google DeepMind 发布 Gemini 3.7 Flash:面向编码与智能体的主力模型

    Google DeepMind 发布 Gemini 3.7 Flash,这是其针对编码和智能体任务的最强主力模型。该版本在 FrontierCode 1.1 Main (43.6% vs 34.4%) 和 DeepSWE v1.1 (65.3% vs 49.0%) 等基准测试中显著优于前代,并在 GDP.pdf 和 AutomationBench 上展现更强的推理能力。

    推荐理由:新模型在代码生成和复杂文档处理上显著提升,且价格减半,适合评估其在生产环境中的成本效益。

8月12日周三
  1. Google DeepMind82

    Google DeepMind 发布 SL2T 手语翻译模型并集成至 Gboard 和 Live Transcribe

    Google DeepMind 推出大规模多语言手语转文本(SL2T)模型,首次将手语AI应用于消费级产品,支持美国手语(ASL)到英语的实时转换。该模型基于超过10万小时、涵盖50多种手语的数据训练,通过MediaPipe Holistic提取人体姿态关键点而非原始视频以保护隐私,直接输出流式文本。

    推荐理由:原文给出了SL2T模型的技术原理、隐私保护机制及在Pixel 11上的落地入口,读者可以据此判断其如何改变聋人用户的输入体验。

8月6日周四
  1. Google DeepMind90

    Google DeepMind 开源 WeatherNext 2 与 Cyclones 模型,气旋预测精度提升相当于十年气象进步

    Google DeepMind 宣布开源 WeatherNext 2 和 WeatherNext Cyclones 模型,其 Nature 论文显示该 AI 模型在气旋路径、强度和风结构预测上达到 SOTA,平均为预报员提供额外一天的预警时间,相当于过去十年的气象技术进步。

    推荐理由:WeatherNext 在气旋预测中实现相当于十年气象进步的精度提升,并开源了模型权重与代码。

8月3日周一
  1. ComfyUI Blog82

    MiniMax H3 发布并获 ComfyUI Day-0 支持

    MiniMax 发布第三代视频模型 H3,这是其首个开放权重的视频模型,已在 ComfyUI 中实现 Day-0 原生支持。该模型支持文本、图像、视频和音频输入,能生成最高 2K 分辨率、15 秒时长的视频,并同步生成原生立体声音频。通过剪枝调制权重、int8 量化及自定义内核等技术,H3 在 ComfyUI 中的显存占用降低 66%,使得 RTX 3060 等消费级 GPU 也能进行本地推理。

    推荐理由:原文说明了 H3 的开放权重特性及在 ComfyUI 中的本地推理优化细节,读者可据此评估其在消费级硬件上的实际部署可行性。

7月30日周四
  1. Google DeepMind80

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型

    Google DeepMind 正式发布 Gemini Robotics ER 2,这是其最新的高阶“具身推理”模型,旨在通过视频理解、任务编排和多机器人协作提升机器人在物理世界中的实用性。

    推荐理由:新模型通过视频理解实现任务进度追踪与多机器人协作,并公开了API接入入口及基准测试数据。

  2. Google DeepMind57

    Google DeepMind 发布 Lyria 3.5 音乐生成模型并上线 Google Flow Music

    Google DeepMind 推出最新音乐生成模型 Lyria 3.5,并即日起在 Google Flow Music 中向用户开放。该模型在音乐性、歌词质量、人声表现和创作控制四个方面进行了升级,包括生成更复杂的旋律结构、提高提示词遵循度、增强人声情感表达以及允许用户更轻松地控制输出节奏和时长。

7月28日周二
  1. Google DeepMind84

    Google DeepMind 发布 Gemini Robotics 2 系列模型

    Google DeepMind 推出 Gemini Robotics 2 系列模型,赋予机器人全身智能控制、精细灵巧操作及多机协作能力。该系列包含用于视觉语言动作控制的 VLA 模型、作为高层大脑的 ER 推理模型以及支持快速适配新硬件的端侧模型。目前 ER 模型已在 Google AI Studio 上线,VLA 和端侧模型向早期合作伙伴开放。

    推荐理由:原文详细拆解了全身体控制、灵巧操作及多机协作的技术实现,为理解通用物理AI的落地路径提供了具体参考。

7月21日周二
7月17日周五
7月1日周三
  1. Google DeepMind78

    Google DeepMind 发布 Nano Banana 2 Lite 图像模型与 Gemini Omni Flash 视频模型

    Google DeepMind 推出 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)和 Gemini Omni Flash(gemini-omni-flash-preview)两款新模型,现已在 Google AI Studio、Gemini API 和 Gemini Enterprise Agent Platform 上线。

    推荐理由:原文给出了两款新模型的定价、延迟指标及 API 接入方式,读者可据此评估其在高吞吐图像生成与视频编辑工作流中的实际成本效益。

6月11日周四
  1. Google DeepMind82

    Google DeepMind 发布 DiffusionGemma:基于扩散的开源实验性文本生成模型

    Google DeepMind 发布 DiffusionGemma,这是一个基于 Apache 2.0 许可的 26B Mixture of Experts (MoE) 实验性开源模型,通过并行生成文本块实现最高 4 倍的推理加速。

    推荐理由:原文给出了扩散模型在本地推理中的速度优势与硬件适配细节,读者可据此评估其在实时交互场景下的可用性。

6月9日周二
  1. Google DeepMind84

    Google DeepMind 发布 Gemini 3.5 Live Translate 音频模型

    Google DeepMind 发布最新音频模型 Gemini 3.5 Live Translate,支持 70 多种语言的近实时语音到语音翻译。该模型能自动检测语言并生成保留说话人语调、节奏和音高的流畅译文,通过持续生成语音而非等待说完来减少停顿。

    推荐理由:原文展示了 Gemini 3.5 Live Translate 在连续流式翻译、保留语调及多端部署上的能力变化,为开发者与企业提供了实时语音交互的新方案。

  2. Google DeepMind82

    Google DeepMind 发布 Gemma 4 12B:统一无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,这是一款旨在在笔记本电脑上运行的高性能多模态模型。该模型采用统一的无编码器架构,视觉和音频输入直接流入 LLM 主干,无需传统独立编码器,从而降低延迟和内存占用。

    推荐理由:原文给出了无编码器统一架构和16GB显存本地运行门槛,读者可以据此判断其在笔记本上实现多模态智能体的可行性。

5月18日周一
  1. Google DeepMind91

    Google DeepMind 发布 Gemini Omni Flash 模型

    Google DeepMind 推出 Gemini Omni 系列首个模型 Gemini Omni Flash,支持从图像、音频、视频和文本输入生成高质量视频,并允许通过自然语言进行多轮对话式编辑。

    推荐理由:原文展示了 Gemini Omni Flash 在视频生成与对话式编辑上的能力,并明确了其在多个 Google 产品中的落地入口。

5月16日周六
  1. Google DeepMind34

    Calico 利用 Co-Scientist 推进衰老研究

    Calico Life Sciences 使用 Google DeepMind 的 Co-Scientist 模型整合衰老生物学文献,生成关于代谢调节整合应激反应(ISR)的新假设。该工具帮助研究人员从混杂数据中识别高价值科学线索,并优化实验设计以验证假设。相关实验已产生对健康与疾病具有重要意义的发现,团队计划发表结果。

  2. Google DeepMind92

    Google DeepMind 发布 Gemini 3.5 Flash 模型

    Google DeepMind 发布 Gemini 3.5 系列并率先推出 3.5 Flash 模型,该模型主打智能体工作流与编码能力,已在 Terminal-Bench 2.1、GDPval-AA 和 MCP Atlas 等基准测试中超越 Gemini 3.1 Pro,输出速度比其他前沿模型快 4 倍。

    推荐理由:原文给出了新模型在智能体与编码基准上的具体分数及速度对比,读者可据此评估其实际性能表现。

4月16日周四
  1. Google DeepMind70

    Google DeepMind 发布 Gemini 3.1 Flash TTS 语音模型

    Google DeepMind 推出最新文本转语音模型 Gemini 3.1 Flash TTS,支持通过嵌入自然语言命令的音频标签来精确控制声音风格、语速和表达方式。该模型在 Artificial Analysis TTS 排行榜上获得 1,211 的 Elo 分数,原生支持多说话人对话及 70 多种语言,所有生成音频均带有 SynthID 水印。

    推荐理由:新模型引入自然语言音频标签以精细控制语速和风格,并在 Artificial Analysis 基准中取得高分。

4月13日周一
  1. Google DeepMind75

    Google DeepMind 发布 Gemini Robotics-ER 1.6 增强具身推理能力

    Google DeepMind 发布 Gemini Robotics-ER 1.6,这是一款专为机器人设计的高层推理模型,显著提升了空间推理、多视角理解和成功检测能力。该模型新增了仪表读取功能,能结合视觉推理与代码执行精确解读压力表等工业仪器,并已通过 Gemini API 和 Google AI Studio 向开发者开放。

    推荐理由:新模型强化了空间推理与仪表读取能力,为机器人自主执行复杂物理任务提供了更可靠的感知基础。