跳到正文

全部动态

今日 0 条
9月16日周三
9月15日周二
  1. ByteByteGo40

    LLM 是否有金鱼般的记忆?

    LLM 本身无持久记忆,其“回忆”能力依赖外部应用将历史对话、摘要或用户偏好重新注入上下文窗口。随着对话增长,重复传输文本导致成本与延迟增加,且受限于模型上下文长度,旧信息需被移除或存储于向量数据库等外部系统。

9月14日周一
9月12日周六
9月11日周五
9月10日周四
  1. OpenAI62

    OpenAI 在 API 中推出 GPT-Live-1 以构建更自然的语音体验

    OpenAI 在 API 中推出 GPT-Live-1,为开发者提供自然的全双工语音对话能力。该模型具备更强的指令遵循能力,并支持自定义声音和电话通信功能。

    推荐理由:原文说明了GPT-Live-1在API中支持全双工对话、自定义声音和电话功能,开发者可据此评估其在实时语音交互场景中的适用性。

  2. OpenAI62

    OpenAI 推出 Agents API

    OpenAI 发布 Agents API,旨在帮助开发者在云端构建和部署智能体。该接口提供了一套用于编排多步任务、工具调用及状态管理的标准化组件。

    推荐理由:原文介绍了面向智能体构建的新 API,开发者可据此评估其在现有工作流中的集成潜力。

  3. Google AI40

    Google DeepMind 用 AI 重现 Burt 和 Ethelle 70 年爱情故事

    Google DeepMind 与导演 Liz Garbus 合作,利用生成式模型修复黑白照片并捕捉人物微表情,在短片《Love, Rendered》中重现了结婚 70 年的 Burt 和 Ethelle 未留影像的初遇记忆。该工作流结合图像恢复与姿态控制,将老年特征映射至年轻形象,旨在通过技术辅助认知衰退患者保留珍贵情感连接。

9月9日周三
9月8日周二
  1. Google DeepMind78

    Google DeepMind 发布 AlphaGenome Atlas:人类基因组 DNA 变异预测平台

    Google DeepMind 推出 AlphaGenome Atlas,这是一个包含人类基因组中 90 亿个单核苷酸变异预测的平台。该工具提供 AVI 评分以快速排序变异影响,并支持通过网站、API 和 Google Antigravity 技能访问。外部合作者已利用其识别罕见病关键变异并发现与常见性状相关的稀有变异。

    推荐理由:原文提供了覆盖全基因组的变异预测平台及评分工具,读者可据此评估其在罕见病研究和群体遗传学中的实际效用。

9月7日周一
9月6日周日
9月4日周五
9月3日周四
  1. Google DeepMind82

    Google DeepMind 发布 WeatherNext 3 全球天气 AI 模型

    Google DeepMind 和 Google Research 推出 WeatherNext 3,这是其最新且最准确的全球天气 AI 模型。该模型直接学习实时卫星观测数据,提供每小时更新的高分辨率预报,地表变量分辨率达 5 公里,较上一代提升约五倍。

    推荐理由:原文详述了模型在分辨率、实时数据接入及降水预测上的具体提升,并说明了其在 Google 生态中的集成方式。

9月2日周三
8月28日周五
8月27日周四
  1. Google DeepMind63

    Google DeepMind 试点全球首个双盲 AI 评估

    Google DeepMind 宣布推出全球首个针对专有前沿 AI 模型的双盲评估机制,旨在通过加密“盒子”隔离外部评估数据,防止模型在测试前接触题目导致的基准污染。该方案与 Singapore AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作,目前已在 Gemini Flash Lite 模型上进行测试。

    推荐理由:原文介绍了利用加密环境防止基准污染的双盲评估方法,为验证前沿模型真实能力提供了新的技术路径。

  2. Google DeepMind78

    Google DeepMind 发布 Gemini 3.5 Transcribe 语音转文字模型

    Google DeepMind 发布最新语音转文字模型 Gemini 3.5 Transcribe,旨在实现精准且智能的实时转录。该模型在 Artificial Analysis 测试中流式和非流式平均词错率分别为 4.0% 和 2.6%,支持超过 85 种语言及最多三个说话人的身份识别。

    推荐理由:原文给出了新模型的流式与非流式词错率数据、多语言支持范围以及开发者 API 接入方式,读者可以据此评估其在实时交互场景中的实际表现。

8月21日周五
8月14日周五
  1. Google DeepMind84

    Google DeepMind 发布 Gemini 3.7 Flash:面向编码与智能体的主力模型

    Google DeepMind 发布 Gemini 3.7 Flash,这是其针对编码和智能体任务的最强主力模型。该版本在 FrontierCode 1.1 Main (43.6% vs 34.4%) 和 DeepSWE v1.1 (65.3% vs 49.0%) 等基准测试中显著优于前代,并在 GDP.pdf 和 AutomationBench 上展现更强的推理能力。

    推荐理由:新模型在代码生成和复杂文档处理上显著提升,且价格减半,适合评估其在生产环境中的成本效益。

8月12日周三
  1. Google DeepMind82

    Google DeepMind 发布 SL2T 手语翻译模型并集成至 Gboard 和 Live Transcribe

    Google DeepMind 推出大规模多语言手语转文本(SL2T)模型,首次将手语AI应用于消费级产品,支持美国手语(ASL)到英语的实时转换。该模型基于超过10万小时、涵盖50多种手语的数据训练,通过MediaPipe Holistic提取人体姿态关键点而非原始视频以保护隐私,直接输出流式文本。

    推荐理由:原文给出了SL2T模型的技术原理、隐私保护机制及在Pixel 11上的落地入口,读者可以据此判断其如何改变聋人用户的输入体验。

8月6日周四
  1. Google DeepMind90

    Google DeepMind 开源 WeatherNext 2 与 Cyclones 模型,气旋预测精度提升相当于十年气象进步

    Google DeepMind 宣布开源 WeatherNext 2 和 WeatherNext Cyclones 模型,其 Nature 论文显示该 AI 模型在气旋路径、强度和风结构预测上达到 SOTA,平均为预报员提供额外一天的预警时间,相当于过去十年的气象技术进步。

    推荐理由:WeatherNext 在气旋预测中实现相当于十年气象进步的精度提升,并开源了模型权重与代码。

8月3日周一
7月30日周四
  1. Google DeepMind80

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型

    Google DeepMind 正式发布 Gemini Robotics ER 2,这是其最新的高阶“具身推理”模型,旨在通过视频理解、任务编排和多机器人协作提升机器人在物理世界中的实用性。

    推荐理由:新模型通过视频理解实现任务进度追踪与多机器人协作,并公开了API接入入口及基准测试数据。

  2. Google DeepMind57

    Google DeepMind 发布 Lyria 3.5 音乐生成模型并上线 Google Flow Music

    Google DeepMind 推出最新音乐生成模型 Lyria 3.5,并即日起在 Google Flow Music 中向用户开放。该模型在音乐性、歌词质量、人声表现和创作控制四个方面进行了升级,包括生成更复杂的旋律结构、提高提示词遵循度、增强人声情感表达以及允许用户更轻松地控制输出节奏和时长。