跳到正文

#模型发布

今日 0 条
9月22日周二
  1. Simon Willison80

    Jev 推出新型大语言模型变体:System One(决策模型)

    TypeSafe AI 上周发布了名为 Jev 的新型模型,属于“System One”或“决策模型”类别。该模型接收文本输入但仅返回浮点数形式的分类结果、置信度评分或概率分布,而非生成文本。

    推荐理由:原文详细拆解了 Jev 的输入输出机制、定价策略及黑盒特性,并列举了社区实验与作者开发的 CLI 插件,为评估此类决策模型的实际应用边界提供了具体参考。

9月21日周一
9月20日周日
  1. ComfyUI Blog72

    Qwen-Image-2.1 开源发布:ComfyUI 原生支持带透明通道的图像生成与编辑

    阿里巴巴 Qwen 团队发布开源图像模型 Qwen-Image-2.1,已在 ComfyUI 中实现原生支持。该模型拥有 7B 参数,基于 MMDiT 架构,核心特性包括生成包含 Alpha 通道的 RGBA 图像、原生 2048×2048 分辨率输出以及支持最多 10 张参考图像的编辑能力。

    推荐理由:该模型在7B参数下原生支持RGBA输出和2K分辨率,无需额外背景移除节点即可直接合成素材。

9月18日周五
9月17日周四
  1. Last Week in AI30

    OpenAI 称解决 Navier–Stokes 问题,Anthropic CEO 提议放缓 AI 发展

    OpenAI 宣布其未发布内部模型解决了 Navier–Stokes 千禧年难题,该过程消耗 300 billion output tokens。尽管引发数学界关于署名与营销的争议,Clay Institute 仍视该问题为未解决。此外,Anthropic CEO Dario Amodei 发文呼吁“Pacing the Frontier”,提出引入第三方评估员及加强全球协调以控制 AI 风险。

9月16日周三
  1. NVIDIA36

    曼彻斯特大学利用 NVIDIA Earth-2 预测英国空气污染

    曼彻斯特大学团队利用 NVIDIA Earth-2 CorrDiff 模型,在 Isambard-AI 超算上仅用两天训练出覆盖全英、分辨率达 2-3 平方公里的空气污染预测模型。该工作流支持在 DGX Spark 桌面 AI 系统上进行推理与再训练,大幅降低算力门槛。团队计划开源数据与工作流,并探索结合边缘设备实现实时决策及智能体交互应用。

  2. Google DeepMind86

    Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 模型

    Google DeepMind 推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款新模型,旨在提升近实时推理能力以支持更复杂的语音交互任务。

    推荐理由:原文披露了 Gemini 3.8 Live 系列在实时推理、多语言切换及后台工具调用上的具体能力升级与基准表现,为构建生产级语音智能体提供了明确的技术参考。

9月12日周六
9月11日周五
9月10日周四
  1. OpenAI62

    OpenAI 在 API 中推出 GPT-Live-1 以构建更自然的语音体验

    OpenAI 在 API 中推出 GPT-Live-1,为开发者提供自然的全双工语音对话能力。该模型具备更强的指令遵循能力,并支持自定义声音和电话通信功能。

    推荐理由:原文说明了GPT-Live-1在API中支持全双工对话、自定义声音和电话功能,开发者可据此评估其在实时语音交互场景中的适用性。

9月9日周三
9月8日周二
9月7日周一
9月4日周五
9月3日周四
  1. Google DeepMind82

    Google DeepMind 发布 WeatherNext 3 全球天气 AI 模型

    Google DeepMind 和 Google Research 推出 WeatherNext 3,这是其最新且最准确的全球天气 AI 模型。该模型直接学习实时卫星观测数据,提供每小时更新的高分辨率预报,地表变量分辨率达 5 公里,较上一代提升约五倍。

    推荐理由:原文详述了模型在分辨率、实时数据接入及降水预测上的具体提升,并说明了其在 Google 生态中的集成方式。

9月2日周三
8月28日周五
8月27日周四
  1. Google DeepMind78

    Google DeepMind 发布 Gemini 3.5 Transcribe 语音转文字模型

    Google DeepMind 发布最新语音转文字模型 Gemini 3.5 Transcribe,旨在实现精准且智能的实时转录。该模型在 Artificial Analysis 测试中流式和非流式平均词错率分别为 4.0% 和 2.6%,支持超过 85 种语言及最多三个说话人的身份识别。

    推荐理由:原文给出了新模型的流式与非流式词错率数据、多语言支持范围以及开发者 API 接入方式,读者可以据此评估其在实时交互场景中的实际表现。

8月21日周五
8月14日周五
  1. ComfyUI Blog80

    MiniMax 发布开源音乐生成模型 MiniMax Music 3

    MiniMax 发布了开源权重音乐生成模型 MiniMax Music 3,该模型已集成至 ComfyUI。它采用双语言模型混合连续合成架构,支持根据歌词和描述生成长达五分钟、结构完整的 32 kHz 立体声歌曲,并提供通过结构化标题对人声和编曲进行细粒度控制的能力。

    推荐理由:原文详细拆解了 MiniMax Music 3 的双 LLM 加 Flow Matching 架构,并提供了在 ComfyUI 中生成完整结构歌曲的具体工作流与参数控制方法。

  2. Google DeepMind84

    Google DeepMind 发布 Gemini 3.7 Flash:面向编码与智能体的主力模型

    Google DeepMind 发布 Gemini 3.7 Flash,这是其针对编码和智能体任务的最强主力模型。该版本在 FrontierCode 1.1 Main (43.6% vs 34.4%) 和 DeepSWE v1.1 (65.3% vs 49.0%) 等基准测试中显著优于前代,并在 GDP.pdf 和 AutomationBench 上展现更强的推理能力。

    推荐理由:新模型在代码生成和复杂文档处理上显著提升,且价格减半,适合评估其在生产环境中的成本效益。

8月12日周三
  1. Google DeepMind82

    Google DeepMind 发布 SL2T 手语翻译模型并集成至 Gboard 和 Live Transcribe

    Google DeepMind 推出大规模多语言手语转文本(SL2T)模型,首次将手语AI应用于消费级产品,支持美国手语(ASL)到英语的实时转换。该模型基于超过10万小时、涵盖50多种手语的数据训练,通过MediaPipe Holistic提取人体姿态关键点而非原始视频以保护隐私,直接输出流式文本。

    推荐理由:原文给出了SL2T模型的技术原理、隐私保护机制及在Pixel 11上的落地入口,读者可以据此判断其如何改变聋人用户的输入体验。

8月6日周四
  1. Google DeepMind90

    Google DeepMind 开源 WeatherNext 2 与 Cyclones 模型,气旋预测精度提升相当于十年气象进步

    Google DeepMind 宣布开源 WeatherNext 2 和 WeatherNext Cyclones 模型,其 Nature 论文显示该 AI 模型在气旋路径、强度和风结构预测上达到 SOTA,平均为预报员提供额外一天的预警时间,相当于过去十年的气象技术进步。

    推荐理由:WeatherNext 在气旋预测中实现相当于十年气象进步的精度提升,并开源了模型权重与代码。

8月3日周一
  1. ComfyUI Blog82

    MiniMax H3 发布并获 ComfyUI Day-0 支持

    MiniMax 发布第三代视频模型 H3,这是其首个开放权重的视频模型,已在 ComfyUI 中实现 Day-0 原生支持。该模型支持文本、图像、视频和音频输入,能生成最高 2K 分辨率、15 秒时长的视频,并同步生成原生立体声音频。通过剪枝调制权重、int8 量化及自定义内核等技术,H3 在 ComfyUI 中的显存占用降低 66%,使得 RTX 3060 等消费级 GPU 也能进行本地推理。

    推荐理由:原文说明了 H3 的开放权重特性及在 ComfyUI 中的本地推理优化细节,读者可据此评估其在消费级硬件上的实际部署可行性。

7月30日周四
  1. Google DeepMind80

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型

    Google DeepMind 正式发布 Gemini Robotics ER 2,这是其最新的高阶“具身推理”模型,旨在通过视频理解、任务编排和多机器人协作提升机器人在物理世界中的实用性。

    推荐理由:新模型通过视频理解实现任务进度追踪与多机器人协作,并公开了API接入入口及基准测试数据。

  2. Google DeepMind57

    Google DeepMind 发布 Lyria 3.5 音乐生成模型并上线 Google Flow Music

    Google DeepMind 推出最新音乐生成模型 Lyria 3.5,并即日起在 Google Flow Music 中向用户开放。该模型在音乐性、歌词质量、人声表现和创作控制四个方面进行了升级,包括生成更复杂的旋律结构、提高提示词遵循度、增强人声情感表达以及允许用户更轻松地控制输出节奏和时长。

7月28日周二
  1. Google DeepMind84

    Google DeepMind 发布 Gemini Robotics 2 系列模型

    Google DeepMind 推出 Gemini Robotics 2 系列模型,赋予机器人全身智能控制、精细灵巧操作及多机协作能力。该系列包含用于视觉语言动作控制的 VLA 模型、作为高层大脑的 ER 推理模型以及支持快速适配新硬件的端侧模型。目前 ER 模型已在 Google AI Studio 上线,VLA 和端侧模型向早期合作伙伴开放。

    推荐理由:原文详细拆解了全身体控制、灵巧操作及多机协作的技术实现,为理解通用物理AI的落地路径提供了具体参考。

7月21日周二
  1. Last Week in AI24

    Last Week in AI #251:Anthropic 发布 Claude Sonnet 5,Etched 获巨额订单,LongCat 2.0 开源

    Anthropic 推出 Claude Sonnet 5,主打限时折扣定价与增强的智能体编码能力,并部署了新的网络安全分类器。Etched 获得价值 10 亿美元的推理硬件需求,中国开源 LongCat 2.0 MoE 模型展示大规模训练效率。Google 同步上线 NotebookLM 视频摘要功能及 Nano Banana 2 Lite 图像生成器。

7月17日周五
7月1日周三
  1. Google DeepMind78

    Google DeepMind 发布 Nano Banana 2 Lite 图像模型与 Gemini Omni Flash 视频模型

    Google DeepMind 推出 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)和 Gemini Omni Flash(gemini-omni-flash-preview)两款新模型,现已在 Google AI Studio、Gemini API 和 Gemini Enterprise Agent Platform 上线。

    推荐理由:原文给出了两款新模型的定价、延迟指标及 API 接入方式,读者可据此评估其在高吞吐图像生成与视频编辑工作流中的实际成本效益。