跳到正文

全部动态

今日 2 条
9月17日周四
9月16日周三
  1. NVIDIA65

    NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 中展示领先性能

    NVIDIA Vera Rubin NVL72 系统在 MLPerf Inference v6.1 预览提交中 debut,其吞吐量比 GB300 NVL72 高出最多 3.7 倍(Qwen3-VL)和 2.5 倍(DeepSeek-R1)。GB300 NVL72 在四机架 288-GPU 配置下实现了 99% 的扩展效率,且软件优化使 v6.1 版本性能较 v6.0 提升最高 1.6 倍。

    推荐理由:原文给出了 Vera Rubin NVL72 在 MLPerf Inference v6.1 中的具体吞吐倍数和扩展效率数据,读者可据此评估新一代硬件对推理成本的实际影响。

  2. NVIDIA36

    曼彻斯特大学利用 NVIDIA Earth-2 预测英国空气污染

    曼彻斯特大学团队利用 NVIDIA Earth-2 CorrDiff 模型,在 Isambard-AI 超算上仅用两天训练出覆盖全英、分辨率达 2-3 平方公里的空气污染预测模型。该工作流支持在 DGX Spark 桌面 AI 系统上进行推理与再训练,大幅降低算力门槛。团队计划开源数据与工作流,并探索结合边缘设备实现实时决策及智能体交互应用。

  3. Google DeepMind86

    Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 模型

    Google DeepMind 推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款新模型,旨在提升近实时推理能力以支持更复杂的语音交互任务。

    推荐理由:原文披露了 Gemini 3.8 Live 系列在实时推理、多语言切换及后台工具调用上的具体能力升级与基准表现,为构建生产级语音智能体提供了明确的技术参考。

  4. NVIDIA68

    NVIDIA 发布 DSX 平台以最大化 AI 工厂生产效率

    NVIDIA 推出 DSX 平台,通过 MaxLPS、Flex 等技术组件优化 AI 工厂每兆瓦的 Token 吞吐量。Lambda 在 HGX B200 集群上的首次验证显示,智能管理固定功率预算可使 Token 吞吐量提升 24%,性能功耗比提高 23%。

    推荐理由:原文披露了 NVIDIA DSX 平台在固定功率预算下提升 Token 吞吐量的实测数据及电网响应案例,为评估 AI 工厂能效优化提供了具体参考。

9月15日周二
  1. The Pragmatic Engineer83

    Gergely Orosz 探访 OpenAI:Codex 如何重塑软件工程流程

    Gergely Orosz 通过实地访谈揭示 OpenAI 内部已全面转向以 Codex 为核心的“智能体软件工厂”,非工程团队使用率从 0% 飙升至 90%,IDE 使用量显著下降。文章详细描述了从上下文收集、智能体代码审查到自动部署的闭环流程,指出 PR 数量激增导致 CI/CD 负载增加约 10 倍,并探讨了原生移动端发布瓶颈及未来工程角色向产品判断力转变的趋势。

    推荐理由:作者实地探访 OpenAI,揭示了 Codex 如何取代 IDE 成为核心工具,以及智能体在代码审查、部署和监控中的自动化实践。

  2. ByteByteGo40

    LLM 是否有金鱼般的记忆?

    LLM 本身无持久记忆,其“回忆”能力依赖外部应用将历史对话、摘要或用户偏好重新注入上下文窗口。随着对话增长,重复传输文本导致成本与延迟增加,且受限于模型上下文长度,旧信息需被移除或存储于向量数据库等外部系统。

9月14日周一
9月12日周六
9月11日周五