跳到正文

#模型发布

今日 0 条
10月3日周六
  1. Hacker News · AI82

    Aleph Alpha 发布开源大语言模型 Kolibri

    Aleph Alpha 发布了名为 Kolibri 的开源大语言模型,采用混合专家架构,总参数 78.1B,每 token 激活约 3.46B。该模型专为德语和英语优化,支持最高 100 万 token 的上下文窗口,并在德语数学推理和长文档检索上表现优异。作者指出其权重需约 78GB 显存,目前仅支持本地部署,且在多轮工具调用和编码任务上弱于部分竞品。

    推荐理由:作者通过实测验证了该模型在德语处理上的效率优势,并详细列出了其在长上下文和推理能力上的具体表现与局限。

10月2日周五
10月1日周四
  1. 极客公园25

    谷歌发布 Gemini 4 Argon;中国生成式 AI 用户超 7 亿;美光净利暴涨 895%

    谷歌发布 Gemini 4 Argon,单次输出上限达约 100 万 tokens,在长流程软件工程测试中创纪录并优于 GPT-6 Astra。CNNIC 报告显示截至 2026 年上半年,我国生成式人工智能用户规模突破 7 亿人,普及率超 50%。美光科技公布 2026 财年财报,归母净利润同比增长 895.07%,并开始量产 512GB DDR5 RDIMM 内存模块。

  2. 爱范儿80

    Gemini 4 Argon 正式发布,写作与知识能力领先但仅向部分伙伴开放

    Google 正式发布旗舰模型 Gemini 4 Argon,目前仅通过 Fairwind 计划向少量网络安全合作伙伴开放,普通用户需等待后续付费 API 和订阅者通道。

    推荐理由:原文梳理了 Gemini 4 Argon 的跑分、定价及开放策略,指出其写作与知识能力优于编程,并提及内部对其实际性能的质疑。

  3. The Decoder84

    Google 发布 Gemini 4 Argon:缩小与 OpenAI 和 Anthropic 差距但未确立明显领先

    Google 发布新前沿模型 Gemini 4 Argon,这是其七个月来的首个前沿模型更新。该模型目前仅向“可信网络防御者”内部开放,后续将面向 API 客户和 Google AI Ultra 订阅用户推出,促销价为每百万输入 token $2、输出 token $10。

    推荐理由:文章汇总了独立评测与官方数据,展示了该模型在智能体任务上的显著进步及极具竞争力的定价策略。

  4. Google DeepMind93

    Google DeepMind 发布 Gemini 4 Argon:面向复杂工作流的前沿智能模型

    Google DeepMind 宣布推出新前沿模型 Gemini 4 Argon,该模型旨在通过深度推理支持复杂的长周期工作流,目前正通过 Fairwind Program 向受信任的网络安全防御者逐步开放。

    推荐理由:原文披露了 Gemini 4 Argon 在长上下文输出、软件工程及网络安全防御上的具体基准数据与分阶段开放策略,为评估前沿模型在复杂工作流中的实际效能提供了关键参考。

9月30日周三
9月29日周二
  1. The Decoder68

    ElevenLabs 发布 Eleven v4 语音模型及 Turbo 变体

    ElevenLabs 发布新语音模型 Eleven v4,通过新架构提升对笑声、耳语等音效标签的遵循准确度,并支持超过 90 种语言。针对实时场景推出的 Turbo 变体将首字延迟降至约 150 毫秒,优于 Cartesia Sonic 3.6 和 OpenAI GPT-4o mini TTS。两款模型现已上线 API 及平台,并在 10 月 12 日前提供临时降价优惠。

  2. 爱范儿78

    爱范儿实测神秘模型 Space Bunny Alpha:草图秒变网站,疑似 MiniMax 出品

    爱范儿对近期在海外 AI 圈刷屏的神秘模型 Space Bunny Alpha 进行了实测,发现其具备极强的多模态理解与 Agent 编程能力,能将粗糙草图在几分钟内转化为可交互的 3D 网站或游戏。

    推荐理由:作者通过实测验证了该匿名模型在草图转网页和3D交互中的快速交付能力,并梳理了其作为日常主力模型的潜在归属线索。

  3. Simon Willison82

    Anthropic 发布 Claude Sonnet 5.5

    Anthropic 发布 Claude Sonnet 5.5,官方称其运行速度提升 30% 以上且多数任务成本降低 30%,在各项基准测试中表现优于 Sonnet 5。Simon Willison 实测发现该模型存在与 Opus 5.5 相同的 Bug,在“max”思考模式下会因消耗过多 token 导致生成失败,但在“xhigh”模式下能以较低成本和较快时间成功输出结果。

    推荐理由:作者实测新模型性能与成本变化,并指出其存在与 Opus 5.5 相同的思考长度 Bug,提供了除官方宣传外的真实使用反馈。

9月26日周六
9月24日周四
9月23日周三
  1. Google DeepMind78

    Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Flash-Lite TTS

    Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持从自然语言提示生成自定义角色声音并逐行指导场景对话。

    推荐理由:原文给出了两款新 TTS 模型的详细能力边界、基准排名及开放入口,读者可据此评估其在创意配音与规模化部署中的实际可用性。

  2. Simon Willison84

    Claude Opus 5.5与GPT-6 Sol/Luna发布及价格战分析

    Anthropic发布Claude Opus 5.5,OpenAI随后推出GPT-6 Sol和Luna,后者价格仅为前代一半。Opus 5.5输入输出价格分别降至$4/M和$20/M,缓存读取价格下降60%。实测显示Opus 5.5在max推理模式下因过度思考耗尽128,000 token上限而失败,且GPT-6 Luna成为OpenAI最便宜的模型之一。

    推荐理由:作者通过实测指出新模型大幅降价引发价格战,并发现Opus 5.5在最高推理模式下存在过度思考导致输出截断的问题。

9月22日周二