OpenAI 挫败协同模型蒸馏攻击
OpenAI 成功挫败了一项旨在提取受保护模型推理过程的协同蒸馏攻击活动。该事件凸显了针对大语言模型的对抗性蒸馏威胁,OpenAI 正着手加强相关防御机制以应对此类安全挑战。
OpenAI 成功挫败了一项旨在提取受保护模型推理过程的协同蒸馏攻击活动。该事件凸显了针对大语言模型的对抗性蒸馏威胁,OpenAI 正着手加强相关防御机制以应对此类安全挑战。
IQuest Research 推出 IQuest-Q1 模型,采用稀疏 MoE 架构,总参数 320B、激活参数 15B。该模型能通过 Prompt 直接生成 HTML 小游戏,并在 RL 训练中精准定位导致 Reward 曲线异常的文本解码空格 Bug。其在 NL2Repo、CyberGym 等基准测试中表现优异,且参与自身研发迭代闭环。
Nvidia CEO Jensen Huang 在接受 CNBC 采访时明确表示,AI 模型蒸馏(即利用其他模型的输出进行训练)属于“竞争”,直接反驳了美国政府此前将其定性为“盗窃”的说法。
DeepSeek 通过 MLA、DSA 及 mHC 等创新技术大幅压缩 KV 缓存,使 V4 Pro 在 1M 上下文下仅需 5.48GB HBM,远低于 GLM5 和 Qwen3。其战略旨在利用 NAND/LPDDR 存储替代算力,扶持中国硬件生态并冲击 1 万亿美元市值。
Google DeepMind 推出 Decoupled DiLoCo 架构,支持在低带宽下跨数据中心进行弹性分布式 LLM 训练。该方案基于 Pathways 和 DiLoCo,通过异步计算隔离硬件故障影响,并在 Gemma 4 模型测试中保持同等 ML 性能。实验显示,使用 2-5 Gbps 网络训练 12B 参数模型的速度比传统同步方法快 20 倍以上,且兼容不同代际 TPU 混合训练。