LEGO-Anything:AI智能体从照片构建3D场景但缺乏自我评估能力
研究人员提出“Image-to-Code”方法,让编码智能体通过迭代编写Blender代码从单张照片重建3D场景。团队发布LEGO-Bench基准测试,发现GPT-6 Astra等模型虽能生成可用场景,但在几何精度上表现不佳且无法准确自我评估重建质量。
研究人员提出“Image-to-Code”方法,让编码智能体通过迭代编写Blender代码从单张照片重建3D场景。团队发布LEGO-Bench基准测试,发现GPT-6 Astra等模型虽能生成可用场景,但在几何精度上表现不佳且无法准确自我评估重建质量。
PaulHoule 在 Hacker News 分享了一篇链接至 arXiv 和 Nature 的论文,探讨 AI 在 Stratego(军棋)这一复杂不完全信息博弈中取得突破。该帖子获得了较高的关注度,引发了社区对 AI 智能体在策略游戏领域进展的讨论。
何恺明团队最新论文提出NAT-ARC,一种不依赖LLM的纯视觉ARC解题方案。该方法通过在ImageNet上进行MAE预训练来初始化视觉编码器,使模型将自然图像中学到的视觉能力迁移至抽象格子推理任务。NAT-ARC在ARC-1基准上单模型pass@2得分63.4%,集成后达70.2%,以约四分之一的参数量逼近专用LLM系统性能,并验证了预训练对视觉路线scaling瓶颈的突破作用。
新研究提出的AI系统Ataraxos击败了Stratego历史上最成功的玩家Jeroen Niemeijer,有效胜率达到85%。该系统仅使用16块Nvidia H100 GPU训练一周,成本不足8000美元,远低于此前DeepMind的DeepNash系统所需的数百万美元。
推荐理由:原文对比了Ataraxos与DeepNash在算力成本上的巨大差异,并展示了其在多种不完全信息博弈中的泛化能力。
Google DeepMind 推出 SynthID Bio,一种专为合成生物学设计的水印技术,可在 AI 生成的蛋白质序列和 3D 结构中嵌入不可见签名,同时保持其生物功能。
推荐理由:原文展示了在蛋白质序列和3D结构中嵌入不可见水印的方法,并验证了其不损害生物功能,为合成生物学提供了新的溯源与安全保障思路。
斯坦福团队推出HomeBody项目,利用GPT-6 Astra控制宇树G1机器人,使其能在从未见过的厨房中根据语言指令完成收拾物品、寻找并递送药物等复杂任务。该系统核心在于将导航、抓取、开抽屉等封装为可复用的电机技能供大模型直接调用,并结合SLAM构建空间记忆与数字孪生环境,从而无需针对新场景重新训练动作策略即可实现泛化执行。
推荐理由:斯坦福团队提出HomeBody框架,通过让GPT-6 Astra调用预定义技能库而非端到端VLA,实现宇树G1在未见厨房中的零样本泛化操作。
一项针对 Web 和移动端对话式 AI Agent 的隐私分析研究发布。该研究聚焦于此类智能体在用户交互过程中的数据收集与隐私保护现状,旨在揭示潜在风险并评估合规性。
研究提出基于 Kahneman 快慢思考理论的多智能体 AI 架构,通过系统 1 快速反应与系统 2 深度推理协同解决窄 AI 局限。该架构利用世界模型提供领域知识,结合自我模型记录历史动作与求解器技能,旨在赋予 AI 类人元认知能力以优化决策过程。
NVIDIA 与 Google DeepMind、EMBL-EBI 等全球研究机构合作,通过 AlphaFold Database 公开了超过2800种病毒的预测3D蛋白复合物结构。
Google DeepMind 宣布推出全球首个针对专有前沿 AI 模型的双盲评估机制,旨在通过加密“盒子”隔离外部评估数据,防止模型在测试前接触题目导致的基准污染。该方案与 Singapore AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作,目前已在 Gemini Flash Lite 模型上进行测试。
推荐理由:原文介绍了利用加密环境防止基准污染的双盲评估方法,为验证前沿模型真实能力提供了新的技术路径。
Google DeepMind 发布 AI Control Roadmap,提出针对内部 AI Agent 的纵深防御框架,将未信任的智能体视为潜在内部威胁。该方案基于 MITRE ATT&CK 构建威胁模型,通过可信 AI 监督、行为分析及分级响应机制(D1-D4/R1-R3)来应对模型能力增长带来的安全风险。
推荐理由:原文公开了内部 AI 控制路线图及百万级智能体轨迹分析数据,为行业提供了可参考的纵深防御框架与实时监测实践。
Google DeepMind公布了一项在塞拉利昂进行的预注册试验结果,显示使用Gemini驱动的Guided Learning工具使学生在八周内数学成绩提升0.258个标准差,相当于1.2至1.7年的典型学习进度。
推荐理由:原文披露了塞拉利昂预注册试验的量化结果,展示了AI作为教学伙伴而非答案引擎的实际效能与行为改变。
斯坦福大学Gary Peltz团队利用Google DeepMind的Co-Scientist加速寻找治疗肝纤维化的重定位药物。相关研究发表于Advanced Science,Peltz让Co-Scientist提出三个候选药物并解释推理过程,同时自己基于文献选出两个候选。
推荐理由:原文展示了Co-Scientist在药物重定位任务中的具体表现,对比了AI筛选与人类专家选药的实际实验结果。
Google DeepMind 宣布启动 AI co-clinician 研究计划,旨在探索 AI 如何作为协作成员增强医生专业能力并提升护理质量。该研究在盲测评估中显示,AI co-clinician 在98个初级保健查询案例中有97例未出现关键错误,且在开放式药物知识问答上超越其他前沿模型。
推荐理由:原文展示了AI在真实临床查询中零关键错误及多模态远程诊疗的模拟评估,为理解医疗AI从文本向实时交互演进提供了具体数据支撑。
Google DeepMind 推出 Decoupled DiLoCo 架构,支持在低带宽下跨数据中心进行弹性分布式 LLM 训练。该方案基于 Pathways 和 DiLoCo,通过异步计算隔离硬件故障影响,并在 Gemma 4 模型测试中保持同等 ML 性能。实验显示,使用 2-5 Gbps 网络训练 12B 参数模型的速度比传统同步方法快 20 倍以上,且兼容不同代际 TPU 混合训练。