跳到正文

#部署/工程

今日 0 条
10月3日周六
10月2日周五
10月1日周四
  1. NVIDIA26

    NVIDIA AI 工厂如何通过高产出、长寿命与通用性最大化投资回报

    NVIDIA AI 工厂通过极致全栈协同设计实现最高能效,Vera Rubin NVL72 系统每兆瓦吞吐量较 GB300 NVL72 提升超 30 倍,DeepSeek V4 Pro 模型成本降低至多 45 倍。CUDA 平台跨代兼容确保持续软件优化,使 A100 等旧硬件在部署六年后仍具商业价值并延长折旧周期。该架构支持从语言到物理 AI 的全类型负载,通过广泛适用性深化需求以最大化投资回报。

9月30日周三
9月25日周五
9月24日周四
  1. GitHub Blog48

    GitHub Copilot 应用如何渲染包含 2,200 个文件的巨型 Pull Request

    GitHub Copilot 应用重构了 Pull Request 视图,以支持包含 2,200 个文件、超百万行变更及 400+ 评论的巨型 PR。该方案将文档高度拆分为确定性代码几何与动态块几何两个独立域,解决了因 Markdown 和异步资源导致的评论高度不可预测问题。通过延迟测量并锚定修正,确保了在极端负载下的滚动流畅性与性能。

9月23日周三
9月22日周二
  1. PyTorch68

    vLLM 推出硬件无关模型层以兼顾前沿性能与多硬件兼容

    vLLM 引入新的“硬件无关”(HW agnostic)模型层,旨在解决内部实现变更导致与 fullgraph torch.compile 不兼容的问题,从而支持非 NVIDIA 加速器、旧款 GPU 及多样化模型。

    推荐理由:vLLM 引入硬件无关层以平衡前沿性能优化与多硬件兼容性,在 H100 上实现接近原生实现的吞吐量。

  2. PyTorch78

    Shopify 如何利用 PyTorch 和 vLLM 构建持续学习循环

    Shopify 通过 PyTorch 和 vLLM 建立持续学习循环,将生产失败数据转化为模型权重更新,使 GraphQL Agent 在超越前沿模型质量的同时降低 96% 的服务成本。该流程包括定义质量评估标准、校准 LLM 裁判、利用自动研究优化基线、通过监督微调和 GRPO 强化学习更新参数,以及使用 Gist 压缩技术减少提示词长度以提升推理速度。

    推荐理由:原文详细拆解了从定义质量到模型微调及提示词压缩的完整闭环,为构建自进化AI系统提供了可复用的工程路径。

  3. NVIDIA38

    NVIDIA 推出 DSX Ready 计划以认证 AI 工厂电源与冷却产品

    NVIDIA 发布 DSX Ready 认证计划,旨在验证符合其 AI 工厂参考设计要求的合作伙伴产品。该计划首批涵盖电池储能系统(BESS)和冷却分配单元(CDU),已纳入 Hitachi Energy、Tesla、LG Electronics 等厂商方案。此举帮助构建者降低集成风险,确保电源与冷却设施适配整体架构以优化 AI 产出。

9月17日周四
9月16日周三
  1. NVIDIA65

    NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 中展示领先性能

    NVIDIA Vera Rubin NVL72 系统在 MLPerf Inference v6.1 预览提交中 debut,其吞吐量比 GB300 NVL72 高出最多 3.7 倍(Qwen3-VL)和 2.5 倍(DeepSeek-R1)。GB300 NVL72 在四机架 288-GPU 配置下实现了 99% 的扩展效率,且软件优化使 v6.1 版本性能较 v6.0 提升最高 1.6 倍。

    推荐理由:原文给出了 Vera Rubin NVL72 在 MLPerf Inference v6.1 中的具体吞吐倍数和扩展效率数据,读者可据此评估新一代硬件对推理成本的实际影响。

9月15日周二
9月11日周五