跳到正文

#编码

今日 0 条
10月3日周六
10月2日周五
10月1日周四
  1. GitHub Blog26

    GitHub Universe 2026 十大技术演讲精选

    GitHub Universe 2026 聚焦 Copilot 记忆基准、MCP 细粒度授权及 Vite+ 工具链等前沿议题。GitHub 研究揭示累积上下文可能降低性能,Pomerium 演示身份感知代理以强化 MCP 安全边界。此外,会议还将探讨 npm 供应链风险、AI 代码验证机制及低连接环境下的软件开发实践。

  2. Google DeepMind93

    Google DeepMind 发布 Gemini 4 Argon:面向复杂工作流的前沿智能模型

    Google DeepMind 宣布推出新前沿模型 Gemini 4 Argon,该模型旨在通过深度推理支持复杂的长周期工作流,目前正通过 Fairwind Program 向受信任的网络安全防御者逐步开放。

    推荐理由:原文披露了 Gemini 4 Argon 在长上下文输出、软件工程及网络安全防御上的具体基准数据与分阶段开放策略,为评估前沿模型在复杂工作流中的实际效能提供了关键参考。

9月30日周三
9月28日周一
9月26日周六
9月25日周五
9月18日周五
9月16日周三
9月12日周六
9月9日周三
9月8日周二
9月6日周日
9月3日周四
8月14日周五
  1. Google DeepMind84

    Google DeepMind 发布 Gemini 3.7 Flash:面向编码与智能体的主力模型

    Google DeepMind 发布 Gemini 3.7 Flash,这是其针对编码和智能体任务的最强主力模型。该版本在 FrontierCode 1.1 Main (43.6% vs 34.4%) 和 DeepSWE v1.1 (65.3% vs 49.0%) 等基准测试中显著优于前代,并在 GDP.pdf 和 AutomationBench 上展现更强的推理能力。

    推荐理由:新模型在代码生成和复杂文档处理上显著提升,且价格减半,适合评估其在生产环境中的成本效益。

7月21日周二
7月17日周五
5月16日周六
  1. Google DeepMind92

    Google DeepMind 发布 Gemini 3.5 Flash 模型

    Google DeepMind 发布 Gemini 3.5 系列并率先推出 3.5 Flash 模型,该模型主打智能体工作流与编码能力,已在 Terminal-Bench 2.1、GDPval-AA 和 MCP Atlas 等基准测试中超越 Gemini 3.1 Pro,输出速度比其他前沿模型快 4 倍。

    推荐理由:原文给出了新模型在智能体与编码基准上的具体分数及速度对比,读者可据此评估其实际性能表现。