Comfy API 正式上线:支持将 ComfyUI 工作流部署为生产级 API
Comfy API 正式向所有付费 Comfy 计划用户开放,允许将 ComfyUI 工作流及其自定义节点、LoRAs、模型和 Python 依赖打包并部署为自动扩缩容的 API 端点。
推荐理由:Comfy API 将工作流环境打包为自动扩缩容端点,解决了从本地 ComfyUI 到生产部署的环境重建难题。
把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。
Comfy API 正式向所有付费 Comfy 计划用户开放,允许将 ComfyUI 工作流及其自定义节点、LoRAs、模型和 Python 依赖打包并部署为自动扩缩容的 API 端点。
推荐理由:Comfy API 将工作流环境打包为自动扩缩容端点,解决了从本地 ComfyUI 到生产部署的环境重建难题。
vLLM 引入新的“硬件无关”(HW agnostic)模型层,旨在解决内部实现变更导致与 fullgraph torch.compile 不兼容的问题,从而支持非 NVIDIA 加速器、旧款 GPU 及多样化模型。
推荐理由:vLLM 引入硬件无关层以平衡前沿性能优化与多硬件兼容性,在 H100 上实现接近原生实现的吞吐量。
Shopify 通过 PyTorch 和 vLLM 建立持续学习循环,将生产失败数据转化为模型权重更新,使 GraphQL Agent 在超越前沿模型质量的同时降低 96% 的服务成本。该流程包括定义质量评估标准、校准 LLM 裁判、利用自动研究优化基线、通过监督微调和 GRPO 强化学习更新参数,以及使用 Gist 压缩技术减少提示词长度以提升推理速度。
推荐理由:原文详细拆解了从定义质量到模型微调及提示词压缩的完整闭环,为构建自进化AI系统提供了可复用的工程路径。
NVIDIA Vera Rubin NVL72 系统在 MLPerf Inference v6.1 预览提交中 debut,其吞吐量比 GB300 NVL72 高出最多 3.7 倍(Qwen3-VL)和 2.5 倍(DeepSeek-R1)。GB300 NVL72 在四机架 288-GPU 配置下实现了 99% 的扩展效率,且软件优化使 v6.1 版本性能较 v6.0 提升最高 1.6 倍。
推荐理由:原文给出了 Vera Rubin NVL72 在 MLPerf Inference v6.1 中的具体吞吐倍数和扩展效率数据,读者可据此评估新一代硬件对推理成本的实际影响。
NVIDIA 在 AI Infra Summit 上公布 Vera Rubin 和 DSX 平台的最新进展,重点展示了通过优化 Tokens Per Watt 提升 AI 工厂能效的成果。
推荐理由:原文披露了 Vera Rubin 与 DSX 平台在 tokens per watt 上的实测数据,读者可据此评估 AI 工厂的能效优化路径。