跳到正文

#部署/工程

今日 0 条
10月3日周六
  1. ByteByteGo23

    SSH 工作原理详解

    SSH 通过 TCP 连接建立安全通道,双方交换版本并协商加密算法。客户端验证服务器公钥后,各自独立计算会话密钥且不通过网络传输。认证阶段客户端使用私钥签名请求,服务器利用 authorized_keys 中的公钥验证签名以完成身份确认。

10月2日周五
10月1日周四
  1. NVIDIA26

    NVIDIA AI 工厂如何通过高产出、长寿命与通用性最大化投资回报

    NVIDIA AI 工厂通过极致全栈协同设计实现最高能效,Vera Rubin NVL72 系统每兆瓦吞吐量较 GB300 NVL72 提升超 30 倍,DeepSeek V4 Pro 模型成本降低至多 45 倍。CUDA 平台跨代兼容确保持续软件优化,使 A100 等旧硬件在部署六年后仍具商业价值并延长折旧周期。该架构支持从语言到物理 AI 的全类型负载,通过广泛适用性深化需求以最大化投资回报。

  2. 极客公园40

    阿里云升级Agent基础设施,实现数据处理耗时减少40%与训练提速2.4倍

    阿里云在云栖大会发布针对Agent负载的基础设施升级方案,通过MaxCompute和EMR优化使具身智能数据处理耗时减少40%,PAI-DLC 3.0将多模态模型端到端训练速度提升2.4倍。新推出的ADA服务采用多智能体协同,配合Hologres自进化查询优化器,旨在打通从数据入湖到系统自我进化的全链路,解决Agent并发试错带来的计算压力。

9月30日周三
9月29日周二
  1. MIT Technology Review · AI28

    企业如何从按量付费转向拥有AI算力以实现成本可控

    当AI工作负载进入生产环境且需求稳定时,企业应评估是否从按Token计费的消费模式转向拥有算力资产。Deloitte数据显示2025年员工AI访问率上升5%,预计六个月内至少40%项目投产的企业占比将翻倍。决策关键在于找到利用率临界点,通过多工作负载共享基础设施分摊固定成本,并建立运营模型确保持续产生价值。

9月25日周五
9月24日周四
  1. GitHub Blog48

    GitHub Copilot 应用如何渲染包含 2,200 个文件的巨型 Pull Request

    GitHub Copilot 应用重构了 Pull Request 视图,以支持包含 2,200 个文件、超百万行变更及 400+ 评论的巨型 PR。该方案将文档高度拆分为确定性代码几何与动态块几何两个独立域,解决了因 Markdown 和异步资源导致的评论高度不可预测问题。通过延迟测量并锚定修正,确保了在极端负载下的滚动流畅性与性能。

9月23日周三
9月22日周二
  1. PyTorch68

    vLLM 推出硬件无关模型层以兼顾前沿性能与多硬件兼容

    vLLM 引入新的“硬件无关”(HW agnostic)模型层,旨在解决内部实现变更导致与 fullgraph torch.compile 不兼容的问题,从而支持非 NVIDIA 加速器、旧款 GPU 及多样化模型。

    推荐理由:vLLM 引入硬件无关层以平衡前沿性能优化与多硬件兼容性,在 H100 上实现接近原生实现的吞吐量。

  2. PyTorch78

    Shopify 如何利用 PyTorch 和 vLLM 构建持续学习循环

    Shopify 通过 PyTorch 和 vLLM 建立持续学习循环,将生产失败数据转化为模型权重更新,使 GraphQL Agent 在超越前沿模型质量的同时降低 96% 的服务成本。该流程包括定义质量评估标准、校准 LLM 裁判、利用自动研究优化基线、通过监督微调和 GRPO 强化学习更新参数,以及使用 Gist 压缩技术减少提示词长度以提升推理速度。

    推荐理由:原文详细拆解了从定义质量到模型微调及提示词压缩的完整闭环,为构建自进化AI系统提供了可复用的工程路径。

  3. NVIDIA38

    NVIDIA 推出 DSX Ready 计划以认证 AI 工厂电源与冷却产品

    NVIDIA 发布 DSX Ready 认证计划,旨在验证符合其 AI 工厂参考设计要求的合作伙伴产品。该计划首批涵盖电池储能系统(BESS)和冷却分配单元(CDU),已纳入 Hitachi Energy、Tesla、LG Electronics 等厂商方案。此举帮助构建者降低集成风险,确保电源与冷却设施适配整体架构以优化 AI 产出。

9月21日周一
  1. ByteByteGo35

    如何在廉价硬件上运行大模型:量化、卸载与蒸馏等技术解析

    在普通硬件运行大模型需通过量化、层级卸载、混合专家、知识蒸馏、剪枝及推测解码等技术降低内存占用与计算量。以8B参数模型为例,仅权重即需约16GB内存,且受限于RAM/VRAM容量及带宽瓶颈。这些方法旨在解决推理阶段的显存不足问题,使已训练模型能在资源受限设备上实现可用响应速度。

9月18日周五
  1. 阮一峰的网络日志26

    阮一峰科技爱好者周刊第413期:Shopify弃用React Native转原生开发

    Shopify宣布放弃React Native,改用Swift和Kotlin进行iOS与安卓的原生开发。作者指出AI作为自动翻译器使中间语言层失去价值,且React Native长期存在技术缺陷。此外,联合国投票决定废除墨卡托投影,建议采用面积比例不失真的平等地球投影法绘制世界地图。

9月17日周四
9月16日周三
  1. NVIDIA65

    NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 中展示领先性能

    NVIDIA Vera Rubin NVL72 系统在 MLPerf Inference v6.1 预览提交中 debut,其吞吐量比 GB300 NVL72 高出最多 3.7 倍(Qwen3-VL)和 2.5 倍(DeepSeek-R1)。GB300 NVL72 在四机架 288-GPU 配置下实现了 99% 的扩展效率,且软件优化使 v6.1 版本性能较 v6.0 提升最高 1.6 倍。

    推荐理由:原文给出了 Vera Rubin NVL72 在 MLPerf Inference v6.1 中的具体吞吐倍数和扩展效率数据,读者可据此评估新一代硬件对推理成本的实际影响。

9月15日周二
9月11日周五
9月9日周三
9月7日周一
  1. ByteByteGo43

    LLM 应用如何处理错误与故障

    LLM 应用因输出概率性、幻觉及格式错误,需区别于传统软件的特殊容错机制。文章详解重试、超时管理、熔断器及优雅降级等策略,以应对网络中断或模型返回无效 JSON 等技术故障。通过分类处理失败场景,确保系统在部分组件失效时仍能维持核心功能运行。

8月26日周三