跳到正文

#推理

今日 0 条
10月3日周六
10月2日周五
  1. MIT Technology Review · AI62

    AlphaGo 核心成员 Thore Graepel 撰文称大语言模型不具备真正推理能力

    AlphaGo 核心成员、伦敦大学学院机器学习教授 Thore Graepel 撰文指出,当前的大语言模型仅具备类似人类“系统 1”的快速联想能力,其生成的思维链本质上仍是下一 token 预测的迭代,并非独立的推理机制。他认为真正的推理需要像 AlphaGo 那样维护显式且可检查的认知状态(如博弈树),通过评估每一步对不确定性的消解程度来更新信念,而非事后编造解释。

  2. 量子位73

    丘成桐新论文致谢GPT和Claude,态度三年间由排斥转向接纳

    丘成桐参与的最新微分几何论文在致谢中感谢了GPT 6 Astra和Claude Pro,称其在部分证明思路和计算中提供了帮助。该论文解决了七维空间28种球面(含27种怪球)能否拥有严格正截面曲率度量的悬置问题。回顾过去三年,丘成桐对AI的态度从2023年认为“不可能影响顶尖数学家”,逐渐转变为认可其在科研效率、资料归纳及具体计算中的辅助作用,但仍强调人类原创思考不可替代。

  3. NVIDIA78

    NVIDIA 发布 GPT-6 Astra Ultrafast:基于 Blackwell GPU 实现 8 倍推理加速

    OpenAI 的 GPT-6 Astra Ultrafast 模型现已通过 NVIDIA Blackwell GPU 在 API 及 ChatGPT Work/Codex 中上线,其 token 生成速度比 Astra Standard 模式快至多 8 倍。

    推荐理由:原文说明了GPT-6 Astra Ultrafast在NVIDIA Blackwell GPU上的8倍加速效果及其对开发者工作流的影响,读者可据此评估其在实际编码和交互场景中的性能提升价值。

  4. 量子位68

    何恺明团队发布NAT-ARC:用ImageNet预训练视觉模型攻克ARC抽象推理

    何恺明团队最新论文提出NAT-ARC,一种不依赖LLM的纯视觉ARC解题方案。该方法通过在ImageNet上进行MAE预训练来初始化视觉编码器,使模型将自然图像中学到的视觉能力迁移至抽象格子推理任务。NAT-ARC在ARC-1基准上单模型pass@2得分63.4%,集成后达70.2%,以约四分之一的参数量逼近专用LLM系统性能,并验证了预训练对视觉路线scaling瓶颈的突破作用。

10月1日周四
  1. The Decoder84

    AI系统Ataraxos击败Stratego世界冠军Niemeijer

    新研究提出的AI系统Ataraxos击败了Stratego历史上最成功的玩家Jeroen Niemeijer,有效胜率达到85%。该系统仅使用16块Nvidia H100 GPU训练一周,成本不足8000美元,远低于此前DeepMind的DeepNash系统所需的数百万美元。

    推荐理由:原文对比了Ataraxos与DeepNash在算力成本上的巨大差异,并展示了其在多种不完全信息博弈中的泛化能力。

  2. The Decoder84

    Google 发布 Gemini 4 Argon:缩小与 OpenAI 和 Anthropic 差距但未确立明显领先

    Google 发布新前沿模型 Gemini 4 Argon,这是其七个月来的首个前沿模型更新。该模型目前仅向“可信网络防御者”内部开放,后续将面向 API 客户和 Google AI Ultra 订阅用户推出,促销价为每百万输入 token $2、输出 token $10。

    推荐理由:文章汇总了独立评测与官方数据,展示了该模型在智能体任务上的显著进步及极具竞争力的定价策略。

  3. Google DeepMind93

    Google DeepMind 发布 Gemini 4 Argon:面向复杂工作流的前沿智能模型

    Google DeepMind 宣布推出新前沿模型 Gemini 4 Argon,该模型旨在通过深度推理支持复杂的长周期工作流,目前正通过 Fairwind Program 向受信任的网络安全防御者逐步开放。

    推荐理由:原文披露了 Gemini 4 Argon 在长上下文输出、软件工程及网络安全防御上的具体基准数据与分阶段开放策略,为评估前沿模型在复杂工作流中的实际效能提供了关键参考。

9月30日周三
  1. 量子位77

    OpenAI研究员Noam Brown谈多智能体系统与对齐挑战

    OpenAI研究员Noam Brown在播客访谈中讨论了多智能体系统在解决千禧年数学难题中的作用,并指出模型本身的能力才是关键,多智能体仅贡献约10%。他分析了递归自我改进(RSI)的可能性与瓶颈,强调算力与实验串行限制会阻碍智能爆炸式增长。针对Hugging Face事件引发的对齐担忧,Brown探讨了思维链监测的局限性及未来AI安全评估面临的长任务周期挑战。

    推荐理由:原文记录了OpenAI研究员Noam Brown对多智能体系统、递归自我改进及对齐问题的深度思考,提供了关于AI能力边界与安全挑战的内部视角。

9月29日周二
9月28日周一
  1. Hacker News · AI12

    AI 中的快慢思考:元认知的作用

    研究提出基于 Kahneman 快慢思考理论的多智能体 AI 架构,通过系统 1 快速反应与系统 2 深度推理协同解决窄 AI 局限。该架构利用世界模型提供领域知识,结合自我模型记录历史动作与求解器技能,旨在赋予 AI 类人元认知能力以优化决策过程。

9月23日周三
9月22日周二
  1. 极客公园28

    黄仁勋主张企业高薪;宇树发布 Dex5-S 灵巧手;OpenAI 新模型 24 天解决百道数学难题

    OpenAI 神秘新模型在 24 天内攻克包括纳维 - 斯托克斯方程在内的 100 多项世界级数学难题,并成立由 9 名数学家组成的独立顾问组。英伟达 CEO 黄仁勋呼吁企业在 AI 时代尽可能多付薪酬,其员工平均年薪达 28.2 万美元。宇树科技发布单手具备 22 个自由度的 Dex5-S 灵巧手,整机尺寸接近真手,起售价 3.99 万元。

  2. Simon Willison80

    Jev 推出新型大语言模型变体:System One(决策模型)

    TypeSafe AI 上周发布了名为 Jev 的新型模型,属于“System One”或“决策模型”类别。该模型接收文本输入但仅返回浮点数形式的分类结果、置信度评分或概率分布,而非生成文本。

    推荐理由:原文详细拆解了 Jev 的输入输出机制、定价策略及黑盒特性,并列举了社区实验与作者开发的 CLI 插件,为评估此类决策模型的实际应用边界提供了具体参考。

9月21日周一
9月17日周四
  1. Last Week in AI30

    OpenAI 称解决 Navier–Stokes 问题,Anthropic CEO 提议放缓 AI 发展

    OpenAI 宣布其未发布内部模型解决了 Navier–Stokes 千禧年难题,该过程消耗 300 billion output tokens。尽管引发数学界关于署名与营销的争议,Clay Institute 仍视该问题为未解决。此外,Anthropic CEO Dario Amodei 发文呼吁“Pacing the Frontier”,提出引入第三方评估员及加强全球协调以控制 AI 风险。

9月16日周三
  1. NVIDIA65

    NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 中展示领先性能

    NVIDIA Vera Rubin NVL72 系统在 MLPerf Inference v6.1 预览提交中 debut,其吞吐量比 GB300 NVL72 高出最多 3.7 倍(Qwen3-VL)和 2.5 倍(DeepSeek-R1)。GB300 NVL72 在四机架 288-GPU 配置下实现了 99% 的扩展效率,且软件优化使 v6.1 版本性能较 v6.0 提升最高 1.6 倍。

    推荐理由:原文给出了 Vera Rubin NVL72 在 MLPerf Inference v6.1 中的具体吞吐倍数和扩展效率数据,读者可据此评估新一代硬件对推理成本的实际影响。

9月15日周二
  1. ByteByteGo40

    LLM 是否有金鱼般的记忆?

    LLM 本身无持久记忆,其“回忆”能力依赖外部应用将历史对话、摘要或用户偏好重新注入上下文窗口。随着对话增长,重复传输文本导致成本与延迟增加,且受限于模型上下文长度,旧信息需被移除或存储于向量数据库等外部系统。

9月11日周五
9月8日周二
9月7日周一
9月3日周四
5月23日周六
5月12日周二
  1. Google DeepMind82

    Google DeepMind 推出 Co-Scientist 多智能体科研助手

    Google DeepMind 发布基于 Gemini 构建的多智能体 AI 系统 Co-Scientist,旨在通过迭代生成、辩论和演化假设来加速科学研究。该系统包含生成、反思、排名和演化等专用智能体,并引入类似 AlphaGo 的“想法锦标赛”机制对假设进行验证和排序。

    推荐理由:原文展示了多智能体协作生成假设的具体机制及在肝病、ALS等领域的实测案例,为科研人员评估AI辅助发现工具提供了可参考的落地场景。

4月30日周四
  1. 宝玉的分享78

    Demis Hassabis 谈 AGI 缺口、智能体现状与下一个科学突破

    Google DeepMind CEO Demis Hassabis 在 YC 访谈中指出,当前 AI 范式距离 AGI 仍有 50% 概率需要一两个关键突破,主要缺失在于持续学习、长程推理和记忆机制。

    推荐理由:Google DeepMind CEO 详细拆解了 AGI 缺失的关键拼图、智能体投入产出比争议以及科学发现的本质,为理解当前 AI 瓶颈提供了权威视角。