PyTorch 发布 Blackwell 上端到端块缩放 MXFP8 FlashAttention-4 研究
PyTorch 团队扩展 FlashAttention-4 以支持 MXFP8 前向和反向传播,在 LLM 形状上达到 2.85 PF/s 前向和 2 PF/s 反向吞吐量。
PyTorch 团队扩展 FlashAttention-4 以支持 MXFP8 前向和反向传播,在 LLM 形状上达到 2.85 PF/s 前向和 2 PF/s 反向吞吐量。
OpenAI 推出用于追踪、调查和披露模型失准的框架,并同步发布六份关于意外或令人担忧的模型行为的报告。该举措旨在建立标准化的机制以应对大语言模型的安全与对齐挑战。
OpenAI 联合 AARP 在美国 10 个城市为 1,000 名老年人举办免费的 ChatGPT 实操工作坊。该项目旨在帮助老年群体安全地掌握实用的 AI 技能,通过线下互动形式降低技术使用门槛。
LLM 应用依赖 RAG 技术,通过向量数据库将文档分块并转换为嵌入向量以定位语义匹配内容。该过程需平衡分块粒度与上下文完整性,确保检索到准确且有效的政策条款。若仅靠模型内部知识或错误检索,会导致答案过时或遗漏关键条件。
NVIDIA Vera Rubin NVL72 系统在 MLPerf Inference v6.1 预览提交中 debut,其吞吐量比 GB300 NVL72 高出最多 3.7 倍(Qwen3-VL)和 2.5 倍(DeepSeek-R1)。GB300 NVL72 在四机架 288-GPU 配置下实现了 99% 的扩展效率,且软件优化使 v6.1 版本性能较 v6.0 提升最高 1.6 倍。
推荐理由:原文给出了 Vera Rubin NVL72 在 MLPerf Inference v6.1 中的具体吞吐倍数和扩展效率数据,读者可据此评估新一代硬件对推理成本的实际影响。
Emerald AI、Google 和 NVIDIA 宣布成立 AI 能源管理联盟(AEMA),旨在推动能根据电网状况动态管理用电的灵活 AI 数据中心。该联盟采用技术中立且基于性能的规则,通过标准化响应速度等指标,加速美国 AI 基础设施互联并提升电网可靠性。
OpenAI 推出由 AI 驱动的新广告体验,包括 Sponsored Agents、面向营销人员的工具以及与 HubSpot 和 Shopify 的集成。
ChatGPT Work 和 Codex 的分析功能帮助团队理解 AI 使用情况与支出,识别培训需求,并将采用率与业务成果相关联。
Hex 借助 GPT-6 Astra 驱动其数据智能体,将复杂分析结果自动转化为交互式可视化报告。这一功能使企业员工能够轻松生成并分享高质量的视觉化数据分析成果。
OpenAI 发布最新经济研究,展示劳动者如何超越传统角色使用 AI。该研究识别出哪些新活动正成为其工作中反复出现的部分。
曼彻斯特大学团队利用 NVIDIA Earth-2 CorrDiff 模型,在 Isambard-AI 超算上仅用两天训练出覆盖全英、分辨率达 2-3 平方公里的空气污染预测模型。该工作流支持在 DGX Spark 桌面 AI 系统上进行推理与再训练,大幅降低算力门槛。团队计划开源数据与工作流,并探索结合边缘设备实现实时决策及智能体交互应用。
Jev 作为 System One Model,比现有 LLM 快两个数量级且无幻觉;Periodic Neon 在科学分析评测中超越 GPT-6 Astra 和 Claude Fable 5.1。Google 推出 Gemini 3.8 Live 与 3.5 Transcribe 以增强实时语音应用。
Salesforce 在 Dreamforce 大会上宣布推出其首个 CRM 推理模型 Koa,该模型基于 NVIDIA Nemotron 3 Super 构建。
推荐理由:Salesforce 基于 NVIDIA Nemotron 3 Super 推出首个 CRM 推理模型 Koa,在特定业务场景下错误率降低三倍并计划冬季全面开放。
Build with Claude Code 2天强化课程重启,由 John Kim 授课,报名将于24小时后截止。课程涵盖 agentic loop、context engineering、Claude Code Skills、MCPs、hooks 及 Git worktrees 并行开发等生产级工作流。
Google DeepMind 推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款新模型,旨在提升近实时推理能力以支持更复杂的语音交互任务。
推荐理由:原文披露了 Gemini 3.8 Live 系列在实时推理、多语言切换及后台工具调用上的具体能力升级与基准表现,为构建生产级语音智能体提供了明确的技术参考。
NVIDIA 推出 DSX 平台,通过 MaxLPS、Flex 等技术组件优化 AI 工厂每兆瓦的 Token 吞吐量。Lambda 在 HGX B200 集群上的首次验证显示,智能管理固定功率预算可使 Token 吞吐量提升 24%,性能功耗比提高 23%。
推荐理由:原文披露了 NVIDIA DSX 平台在固定功率预算下提升 Token 吞吐量的实测数据及电网响应案例,为评估 AI 工厂能效优化提供了具体参考。
NVIDIA 在 AI Infra Summit 上公布 Vera Rubin 和 DSX 平台的最新进展,重点展示了通过优化 Tokens Per Watt 提升 AI 工厂能效的成果。
推荐理由:原文披露了 Vera Rubin 与 DSX 平台在 tokens per watt 上的实测数据,读者可据此评估 AI 工厂的能效优化路径。
Google AI 发布专题,展示过去十余年人工智能从理论研究转向解决疾病检测、自然灾害预测、教育扩展及经济机会等现实挑战的进展。该系列内容呈现了全球社区与研究人员如何利用 AI 突破确保更多人共享技术红利。
Google 宣布其技术现已支持超过 300 种语言,覆盖全球 86% 人口。同时发布最新气象模型 WeatherNext 3,使提前一天以上的降水预报准确率提升 50%,并已应用于产品。此外还公开了 AlphaGenome Atlas 以预测基因变异影响,并推出 AI & Economy ATLAS 洞察工具。
Google 宣布其技术已支持全球 86% 人口使用的 300 多种语言,并推出 Gemini 3.5 Live Translate 实现 70 种语言的实时语音翻译。
Gergely Orosz 通过实地访谈揭示 OpenAI 内部已全面转向以 Codex 为核心的“智能体软件工厂”,非工程团队使用率从 0% 飙升至 90%,IDE 使用量显著下降。文章详细描述了从上下文收集、智能体代码审查到自动部署的闭环流程,指出 PR 数量激增导致 CI/CD 负载增加约 10 倍,并探讨了原生移动端发布瓶颈及未来工程角色向产品判断力转变的趋势。
推荐理由:作者实地探访 OpenAI,揭示了 Codex 如何取代 IDE 成为核心工具,以及智能体在代码审查、部署和监控中的自动化实践。
LLM 本身无持久记忆,其“回忆”能力依赖外部应用将历史对话、摘要或用户偏好重新注入上下文窗口。随着对话增长,重复传输文本导致成本与延迟增加,且受限于模型上下文长度,旧信息需被移除或存储于向量数据库等外部系统。
Google 上线 AI & Economy ATLAS 交互式开放访问体验,并联合 Google DeepMind 与 MIT FutureTech 发布关于科学家使用 AI 的新研究。数据显示近半数受访科学家每日使用 AI,每周节省约 7 小时,但验证输出耗时导致假设积压等瓶颈显现。
费城儿童医院(CHOP)基于 NVIDIA 联合创立的开源框架 MONAI,将儿童心脏解剖模型生成时间从 4 小时缩短至数秒。该方案结合 Newton 物理引擎与 NVIDIA Warp 框架,在 GPU 加速下实现近乎实时的设备部署模拟,支持全美超 20 家医院开展心脏建模临床工作。
iOS 27 框架显示 Apple 允许将 Siri 后端模型替换为 Claude 或 GPT-5.6,实现模型委托与推理提供商切换。Anthropic 正筹备 Claude Money 功能,支持用户链接银行账户以查询支出和财务计划。OpenAI 收购 Glass Imaging,交易估值超 $300 million,旨在提升智能手机相机画质。
NASA宇航员Christina Koch与Google研究副总裁James Manyika在“技术与社会对话”系列中,围绕太空探索、机器人及AI合作展开讨论。Koch分享其在国际空间站328天驻留、首次全女性太空行走及Artemis II任务经历,并阐述从25万英里外视地球为“生命之舟”的视角。
Google DevFest 2026 于10月1日至12月31日举行,覆盖115个国家的800多场活动。本届以“Build, Secure, Scale”为主题,开发者将通过 codelabs 和 agent-athons 实操 Gemini、Google AI Studio 及 Web MCP 等工具。
文章详解“LLM-as-a-Judge”机制,即利用一个语言模型评估另一个模型的输出。健康的 LLM 应用需在准确性、安全性、速度及成本等多维度保持一致性。由于 LLM 输出非确定性且质量主观,传统测试不足,需结合黄金数据集、自动指标与人工校准构建完整评估栈。
Fyxer 利用 OpenAI 模型、微调、记忆功能及真实用户反馈,打造可信赖的 AI 行政助理。该工具能整理收件箱并以每位用户的语气起草邮件。
Perplexity 采用 GPT-6 Astra 负责撰写通信内容、修改软件及监控生产系统等端到端任务。相比早期模型,Perplexity 对该模型的介入频率大幅降低,显示出对其自主执行能力的更高信任度。
Anthropic CEO Dario Amodei 提议引入独立评估员以验证安全承诺并报告事故,旨在放缓前沿 AI 能力开发速度。Cursor 推出 Projects 功能,支持跨月上下文维护及向数千个 Agent 委派任务,新用户 PR 合并量提升 30%。
ByteByteGo 指出 `git revert` 因后续提交修改相同代码行而触发冲突,需手动解决后继续。文章同时列举 Claude Code 的 CLAUDE.md、Plan Mode、MCP 等 12 项功能,并简述对称/非对称加密差异及负载均衡器在流量分发、SSL 终止等场景的应用。
Cognition 在 Devin 中集成 GPT-6 Astra,以提升其软件测试及验证功能。该改进旨在帮助工程师减少代码审查工作量并加快软件交付速度。
ByteByteGo Live 启动,提供包括 Build with Claude Code、AI Evals in Practice 在内的多门实时课程。相比在线课程约 4% 的完成率,实时课程完成率达 40%,提升约 10 倍。单一会员资格涵盖未来 12 个月所有直播课程及新增内容。
OpenAI 将 Habitat 从 Python 库演进为全球分布式存储平台,目前服务超过 10 亿 ChatGPT 用户。该平台每秒处理 2200 万请求,支撑了大规模在线存储需求。
PHP框架Laravel宣布禁止提交issue,仅接受Pull Request以过滤垃圾信息并降低维护成本。Anthropic利用Claude AI耗时11天将安德鲁·怀尔斯的费马大定理人工证明翻译为Lean语言程序,生成超1300万行代码,创下最长数学程序纪录。
OpenAI 推出 Agents API 公测版,提供托管智能体基础设施以支持长时运行。Cognition 发布 SWE-2 模型,在 FrontierCode 1.1 Main1 基准测试中得分 50.0%,成本降低 64%。该模型性能超越 SWE-1.7 和 Grok 4.6,价格仅为 GPT-5.6 Sol 等模型的几分之一。
AI 智能体因大量使用工具导致计算需求激增,继 GPU 和内存之后引发了新的 CPU 短缺。The Pulse #191 指出这一趋势源于 AI 代理对算力的额外消耗,并建议未来需要更多计算资源的用户尽早锁定供应。
Google Search 通过 AI Mode 的 Canvas 工具为用户生成个性化训练计划,并支持连接 YouTube Music 创建定制跑步歌单。该功能还利用包含超 600 亿条商品列表的 Shopping Graph,提供基于特定约束(如鞋宽、预算)的装备推荐与比价服务,帮助用户高效完成赛前准备。
César de la Fuente 实验室利用 Codex 和 ChatGPT 在现存及已灭绝基因组中搜索抗药性感染的候选抗菌分子。该工作流旨在通过 AI 工具加速发现对抗耐药菌的新型化合物。