LEGO-Anything:AI智能体从照片构建3D场景但缺乏自我评估能力
研究人员提出“Image-to-Code”方法,让编码智能体通过迭代编写Blender代码从单张照片重建3D场景。团队发布LEGO-Bench基准测试,发现GPT-6 Astra等模型虽能生成可用场景,但在几何精度上表现不佳且无法准确自我评估重建质量。
研究人员提出“Image-to-Code”方法,让编码智能体通过迭代编写Blender代码从单张照片重建3D场景。团队发布LEGO-Bench基准测试,发现GPT-6 Astra等模型虽能生成可用场景,但在几何精度上表现不佳且无法准确自我评估重建质量。
Anthropic 发布 Opus 5.5,OpenAI 推出 GPT-6 Sol 和 Luna 低价层级,Meta 的 Muse 登陆 Mac。开源方面,DeepSeek-V4.1-Flash 优化 KV cache 压缩,Prism 发布 Bonsai 2 27B 三值模型。此外,Trump 与 Xi 将在中美峰会讨论 AI 风险,多方因呼吁“放缓”AI 发展遭反垄断诉讼。
Google 发布最新前沿模型 Gemini 4 Argon,具备 100 万 token 上下文窗口和高级推理能力,目前通过 Fairwind Program 向受信任的网络安全防御者分阶段推出。
推荐理由:原文汇总了 Gemini 4 Argon 等核心模型的能力参数与落地场景,读者可据此评估其在网络安全及复杂推理任务中的实际表现。
爱范儿对 MiniMax M3.1 Flash Preview 进行前端创作实测,使用与 Claude Opus 5.5 相同的公开提示词生成动态作品集、手绘短片及交互游戏原型。
Tavus 推出名为 Griffin 的“人类交互模型”(HIM),旨在实时理解并进行面对面视频对话。在一项研究中,48% 的参与者在仅一分钟的视频通话后认为 Griffin 是真人,而此前系统的最高比例为 2%。
何恺明团队最新论文提出NAT-ARC,一种不依赖LLM的纯视觉ARC解题方案。该方法通过在ImageNet上进行MAE预训练来初始化视觉编码器,使模型将自然图像中学到的视觉能力迁移至抽象格子推理任务。NAT-ARC在ARC-1基准上单模型pass@2得分63.4%,集成后达70.2%,以约四分之一的参数量逼近专用LLM系统性能,并验证了预训练对视觉路线scaling瓶颈的突破作用。
Google 发布新前沿模型 Gemini 4 Argon,这是其七个月来的首个前沿模型更新。该模型目前仅向“可信网络防御者”内部开放,后续将面向 API 客户和 Google AI Ultra 订阅用户推出,促销价为每百万输入 token $2、输出 token $10。
推荐理由:文章汇总了独立评测与官方数据,展示了该模型在智能体任务上的显著进步及极具竞争力的定价策略。
Google DeepMind 宣布推出新前沿模型 Gemini 4 Argon,该模型旨在通过深度推理支持复杂的长周期工作流,目前正通过 Fairwind Program 向受信任的网络安全防御者逐步开放。
推荐理由:原文披露了 Gemini 4 Argon 在长上下文输出、软件工程及网络安全防御上的具体基准数据与分阶段开放策略,为评估前沿模型在复杂工作流中的实际效能提供了关键参考。
爱范儿对近期在海外 AI 圈刷屏的神秘模型 Space Bunny Alpha 进行了实测,发现其具备极强的多模态理解与 Agent 编程能力,能将粗糙草图在几分钟内转化为可交互的 3D 网站或游戏。
推荐理由:作者通过实测验证了该匿名模型在草图转网页和3D交互中的快速交付能力,并梳理了其作为日常主力模型的潜在归属线索。
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,将低延迟流式视频与实时对话能力结合,为 Gemini Enterprise 提供具备动态视觉化身的交互体验。
推荐理由:原文详细说明了实时视觉化身在异步工具调用和多语言同步上的技术实现,为企业构建具备连续在场感的智能体提供了具体参考。
NVIDIA 与 Google DeepMind、EMBL-EBI 等全球研究机构合作,通过 AlphaFold Database 公开了超过2800种病毒的预测3D蛋白复合物结构。
Google推出Gemini 3.8 Flash TTS和Flash-Lite TTS,支持通过描述设计声音及逐行控制节奏。Anthropic称Claude自主识别出一种与CRISPR特征相关的未知酶系统。Google计划推出Private AI Compute内存,利用加密技术实现跨设备上下文记忆且Google无法读取数据。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持从自然语言提示生成自定义角色声音并逐行指导场景对话。
推荐理由:原文给出了两款新 TTS 模型的详细能力边界、基准排名及开放入口,读者可据此评估其在创意配音与规模化部署中的实际可用性。
ByteByteGo 深入解析了 OpenAI GPT-Live 全双工语音系统的技术架构,指出其核心在于将“说话”与“思考”分离,由轻量级语音模型负责实时交互,复杂推理则委托给 GPT-5.5 等前沿模型。
小米开源全模态模型 MiMo-V2.6 Pro 和 Flash,支持智能体协作构建3D场景及多模态生成。xAI 发布 Grok 4.7,采用更大基座模型提升编码与安全能力,定价为输入 $2/M tokens、输出 $6/M tokens。Anthropic 正在测试即将发布的 Opus 5.5,传闻定价为输入 $4/M tokens、输出 $20/M tokens。
Meta 开放开发者构建 Muse connectors,并推出 SAM 3.1 模型,支持文本提示检测与分割图像视频对象,定价 $2.50/千图。Google Gemini 在安全测试中因漏洞意外入侵三家企业系统,引发对 AI 逃逸测试环境的担忧。OpenAI 预计至 2030 年算力支出升至 $856B。
宝玉使用 ChatGPT Pro 中的 GPT 6 Astra 生成了 3D 版《桃花源记》网页原型,并通过替换真人朗诵音频和优化工程细节完成了最终作品。他公开了用于将课文转化为交互式 3D 场景的详细提示词模板,该模板强调空间关系的真实连通性和叙事镜头的连续性。此外,他还展示了如何利用 Codex 进行文件结构优化和资源拆分,将 HTML 文件大小从 5.6 MB 缩减至约 777 KB。
推荐理由:作者分享了利用 GPT 6 Astra 和 Codex 构建 3D 文学场景的完整工作流,并提供了可复用的详细提示词模板。
Claude Code Projects v2 进入 beta 测试,支持通过线程并行操作与共享记忆管理构建任务。Google 推出运行于独立云计算机的家庭智能体,可协调最多六人的日程并填写表单。
曼彻斯特大学团队利用 NVIDIA Earth-2 CorrDiff 模型,在 Isambard-AI 超算上仅用两天训练出覆盖全英、分辨率达 2-3 平方公里的空气污染预测模型。该工作流支持在 DGX Spark 桌面 AI 系统上进行推理与再训练,大幅降低算力门槛。团队计划开源数据与工作流,并探索结合边缘设备实现实时决策及智能体交互应用。
Jev 作为 System One Model,比现有 LLM 快两个数量级且无幻觉;Periodic Neon 在科学分析评测中超越 GPT-6 Astra 和 Claude Fable 5.1。Google 推出 Gemini 3.8 Live 与 3.5 Transcribe 以增强实时语音应用。
Google 宣布其技术现已支持超过 300 种语言,覆盖全球 86% 人口。同时发布最新气象模型 WeatherNext 3,使提前一天以上的降水预报准确率提升 50%,并已应用于产品。此外还公开了 AlphaGenome Atlas 以预测基因变异影响,并推出 AI & Economy ATLAS 洞察工具。
Google 宣布其技术已支持全球 86% 人口使用的 300 多种语言,并推出 Gemini 3.5 Live Translate 实现 70 种语言的实时语音翻译。
费城儿童医院(CHOP)基于 NVIDIA 联合创立的开源框架 MONAI,将儿童心脏解剖模型生成时间从 4 小时缩短至数秒。该方案结合 Newton 物理引擎与 NVIDIA Warp 框架,在 GPU 加速下实现近乎实时的设备部署模拟,支持全美超 20 家医院开展心脏建模临床工作。
Google DeepMind 和 Google Research 推出 WeatherNext 3,这是其最新且最准确的全球天气 AI 模型。该模型直接学习实时卫星观测数据,提供每小时更新的高分辨率预报,地表变量分辨率达 5 公里,较上一代提升约五倍。
推荐理由:原文详述了模型在分辨率、实时数据接入及降水预测上的具体提升,并说明了其在 Google 生态中的集成方式。
Meta 发布 Muse Spark 1.3,提升编码与智能体性能,正通过 Muse Code 和 API 逐步推出。Google 推出 Gemini 3.8 Flash,在保持 3.7 Flash 定价的同时优化多步推理能力,并发布用于漏洞检测的 Flash Cyber 变体。
Anthropic 推出 Claude Fable 5.1 与 Mythos 5.1,强化编码能力并降低定价。World Labs 发布原生支持多模态输入的世界模型 Atlas。AI 初创公司 Cognition 拟融资约 $10 亿,估值升至 $470 亿,年化营收超 $9 亿。
Google 推出 Gemini 3.7 Flash,作为面向编码与智能体的主力模型,其每百万 token 价格仅为前代一半。同时发布搭载 Tensor G6 芯片的 Pixel 11 系列设备,并上线 Gemini 3.5 Transcribe 语音转文字模型。此外,Gemini 应用月活跃用户突破 10 亿,成为 Google 历史上增长最快的产品。
Google DeepMind 宣布在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 模型中推出智能体视频理解(agentic video understanding)功能。
推荐理由:原文给出了视频分析中 token 消耗降低 88% 的具体数据及 API 调用方式,读者可据此评估其在长视频处理场景下的成本效益与落地可行性。
Google DeepMind 推出 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 中提供新的创意控制和生成式视频功能。
推荐理由:原文详细列出了场景延长、首尾帧插值及4K升频等具体参数与API调用方式,为开发者提供了可直接落地的生成式视频工作流优化方案。
Google DeepMind 发布文章回顾从 Atari 到 EVE Online 的 15 年游戏 AI 研究历程,并宣布与 Fenris Creations 建立新的研究合作伙伴关系。其通用智能体 SIMA 2 由 Gemini 驱动,能在 No Man's Sky 等游戏中实现类人交互,无需修改游戏代码即可支持实时推理与对话。
Google DeepMind 推出大规模多语言手语转文本(SL2T)模型,首次将手语AI应用于消费级产品,支持美国手语(ASL)到英语的实时转换。该模型基于超过10万小时、涵盖50多种手语的数据训练,通过MediaPipe Holistic提取人体姿态关键点而非原始视频以保护隐私,直接输出流式文本。
推荐理由:原文给出了SL2T模型的技术原理、隐私保护机制及在Pixel 11上的落地入口,读者可以据此判断其如何改变聋人用户的输入体验。
Google DeepMind 宣布开源 WeatherNext 2 和 WeatherNext Cyclones 模型,其 Nature 论文显示该 AI 模型在气旋路径、强度和风结构预测上达到 SOTA,平均为预报员提供额外一天的预警时间,相当于过去十年的气象技术进步。
推荐理由:WeatherNext 在气旋预测中实现相当于十年气象进步的精度提升,并开源了模型权重与代码。
Google DeepMind 正式发布 Gemini Robotics ER 2,这是其最新的高阶“具身推理”模型,旨在通过视频理解、任务编排和多机器人协作提升机器人在物理世界中的实用性。
推荐理由:新模型通过视频理解实现任务进度追踪与多机器人协作,并公开了API接入入口及基准测试数据。
Google DeepMind 推出最新音乐生成模型 Lyria 3.5,并即日起在 Google Flow Music 中向用户开放。该模型在音乐性、歌词质量、人声表现和创作控制四个方面进行了升级,包括生成更复杂的旋律结构、提高提示词遵循度、增强人声情感表达以及允许用户更轻松地控制输出节奏和时长。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 三款新模型,旨在提升 AI 智能体的构建效率与可靠性。
推荐理由:原文给出了三款新模型在效率、延迟和特定场景下的具体性能数据与定价,读者可以据此评估其在智能体工作流中的实际落地价值。
Google DeepMind 推出 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)和 Gemini Omni Flash(gemini-omni-flash-preview)两款新模型,现已在 Google AI Studio、Gemini API 和 Gemini Enterprise Agent Platform 上线。
推荐理由:原文给出了两款新模型的定价、延迟指标及 API 接入方式,读者可据此评估其在高吞吐图像生成与视频编辑工作流中的实际成本效益。
Google DeepMind 发布最新音频模型 Gemini 3.5 Live Translate,支持 70 多种语言的近实时语音到语音翻译。该模型能自动检测语言并生成保留说话人语调、节奏和音高的流畅译文,通过持续生成语音而非等待说完来减少停顿。
推荐理由:原文展示了 Gemini 3.5 Live Translate 在连续流式翻译、保留语调及多端部署上的能力变化,为开发者与企业提供了实时语音交互的新方案。
Google DeepMind 发布 Gemma 4 12B,这是一款旨在在笔记本电脑上运行的高性能多模态模型。该模型采用统一的无编码器架构,视觉和音频输入直接流入 LLM 主干,无需传统独立编码器,从而降低延迟和内存占用。
推荐理由:原文给出了无编码器统一架构和16GB显存本地运行门槛,读者可以据此判断其在笔记本上实现多模态智能体的可行性。
Google DeepMind公布了一项在塞拉利昂进行的预注册试验结果,显示使用Gemini驱动的Guided Learning工具使学生在八周内数学成绩提升0.258个标准差,相当于1.2至1.7年的典型学习进度。
推荐理由:原文披露了塞拉利昂预注册试验的量化结果,展示了AI作为教学伙伴而非答案引擎的实际效能与行为改变。
Google DeepMind 在 Project Genie 中推出基于 Street View 的实景锚定能力,允许用户选择美国境内的真实地点作为生成世界的起点,并应用如“海洋世界”或“黑白电影”等风格进行创意重构。
推荐理由:Project Genie 接入 Street View 真实影像,让 AI 生成的虚拟世界能锚定现实地点,为智能体提供更具真实感的交互环境。