OpenAI 挫败协同模型蒸馏攻击
OpenAI 成功挫败了一项旨在提取受保护模型推理过程的协同蒸馏攻击活动。该事件凸显了针对大语言模型的对抗性蒸馏威胁,OpenAI 正着手加强相关防御机制以应对此类安全挑战。
OpenAI 成功挫败了一项旨在提取受保护模型推理过程的协同蒸馏攻击活动。该事件凸显了针对大语言模型的对抗性蒸馏威胁,OpenAI 正着手加强相关防御机制以应对此类安全挑战。
PyTorch Conference North America 2026 聚焦 Ray 分布式计算框架,Ion Stoica 将发表关于 Ray 与 Kubernetes 协同演进的主题演讲。
Bain & Company 报告指出,AI 行业需在 2031 年前实现 6T 美元年收入,以证明数据中心巨额资本支出的合理性。新产品开发预计贡献 4.2T 美元收入,企业生产力领域需 1T 至 1.4T 美元。随着 AI 基础设施年支出可能达 1.5T 美元,吸收速度成为新的竞争变量。
IQuest Research 推出 IQuest-Q1 模型,采用稀疏 MoE 架构,总参数 320B、激活参数 15B。该模型能通过 Prompt 直接生成 HTML 小游戏,并在 RL 训练中精准定位导致 Reward 曲线异常的文本解码空格 Bug。其在 NL2Repo、CyberGym 等基准测试中表现优异,且参与自身研发迭代闭环。
拼多多在雄安组建超5000人团队,提前完成年度招聘计划。该基地定位为传统产业数据处理与制造服务中心,承担算法标注、模型训练及平台治理等后台职能。目前正测试“试衣镜”项目,通过视觉标注优化服装展示以提升转化率并降低退货率。
Nvidia CEO Jensen Huang 在接受 CNBC 采访时明确表示,AI 模型蒸馏(即利用其他模型的输出进行训练)属于“竞争”,直接反驳了美国政府此前将其定性为“盗窃”的说法。
阿里云在中国汽车公有云市场份额达 45.2%,在六项细分赛道均获第一。其通过千问座舱 Agent、真武 V900 芯片及数据产线重构,实现从智能驾驶到组织效能的全链路覆盖。目前已有超 30 家车企基于阿里云开展研发,平头哥真武 810E 实践规模超 15 万卡。
百度昆仑芯已完成三代 AI 芯片研发与商业化,并于 2026 年初向港交所提交上市申请。该芯片累计部署数万片,支撑国内首个全自研三万卡集群,后续将推出 M100、M300 产品。李彦宏表示,百度通过十余年技术投入,使昆仑芯等长周期项目进入回报阶段。
当提示词和 RAG 无法解决模型特定行为缺陷时,需通过微调(Fine-tuning)改变参数。LoRA 和 QLoRA 技术通过减少资源消耗,使基于现有模型的定制化训练更实用。文章详解了从指令不足到利用监督微调(SFT)及低秩适配优化模型表现的具体策略。
DeepSeek 通过 MLA、DSA 及 mHC 等创新技术大幅压缩 KV 缓存,使 V4 Pro 在 1M 上下文下仅需 5.48GB HBM,远低于 GLM5 和 Qwen3。其战略旨在利用 NAND/LPDDR 存储替代算力,扶持中国硬件生态并冲击 1 万亿美元市值。
Google DeepMind 宣布与韩国科学技术信息通信部(MSIT)建立合作伙伴关系,将在首尔设立 AI Campus。双方将利用 AlphaEvolve、AlphaFold 等前沿模型加速生命科学与气候研究,并深化在 AI 安全及人才培养领域的协作。
Google DeepMind 推出 Decoupled DiLoCo 架构,支持在低带宽下跨数据中心进行弹性分布式 LLM 训练。该方案基于 Pathways 和 DiLoCo,通过异步计算隔离硬件故障影响,并在 Gemma 4 模型测试中保持同等 ML 性能。实验显示,使用 2-5 Gbps 网络训练 12B 参数模型的速度比传统同步方法快 20 倍以上,且兼容不同代际 TPU 混合训练。