开源 Lego AI 生成器发布:基于 GPT-6 Astra 与 Opus 5.5 生成 LDraw 模型
开发者推出开源 Lego AI 生成器,利用 GPT-6 Astra 和 Opus 5.5 生成 LDraw 源代码以构建 LEGO CAD 模型。该工具集打包为 Dockerized Web 应用,支持 OpenAI、Claude 及 OpenRouter 等多个提供商,用户可通过文本编辑器查看 .mpd 文件内部指令细节。
开发者推出开源 Lego AI 生成器,利用 GPT-6 Astra 和 Opus 5.5 生成 LDraw 源代码以构建 LEGO CAD 模型。该工具集打包为 Dockerized Web 应用,支持 OpenAI、Claude 及 OpenRouter 等多个提供商,用户可通过文本编辑器查看 .mpd 文件内部指令细节。
Black Forest Labs 发布了 Flux 3 Image,这是其 Flux 3 模型家族的图像侧版本。该模型支持在不改变图片其他部分的情况下进行多步编辑,涵盖文生图、图生图、文字渲染和照片级真实感。
Ideogram 推出新模型 Ideogram 4.5,声称能在编辑图像局部时保持其余部分不变,避免产生伪影。该模型适用于产品摄影、室内设计等场景,提供从0.8美分到22美分的四档质量选项,均支持原生2K分辨率,现已通过平台及API开放使用。
GPT-6 Astra 构建了实验性工具 Photo Scrubber,用于自动识别并模糊照片中的陌生人面孔。该工具基于 Google MediaPipe C++ 库编译的 WebAssembly 及 BlazeFace 模型,支持本地运行以移除元数据。
Hyper3D 近日上线 Agentic Mode,整合 Rodin 与 LLM 多模态能力,实现自主理解输入并规划建模路径。该功能将生成范围拓展至工业设计,支持从带尺寸图纸生成可调整三维模型。此前其已通过 MCP 接入 Codex、Claude Code 等智能体,旨在降低专业 3D 创作门槛。
阿里巴巴 Qwen 团队发布开源图像模型 Qwen-Image-2.1,已在 ComfyUI 中实现原生支持。该模型拥有 7B 参数,基于 MMDiT 架构,核心特性包括生成包含 Alpha 通道的 RGBA 图像、原生 2048×2048 分辨率输出以及支持最多 10 张参考图像的编辑能力。
推荐理由:该模型在7B参数下原生支持RGBA输出和2K分辨率,无需额外背景移除节点即可直接合成素材。
Google DeepMind 与导演 Liz Garbus 合作,利用生成式模型修复黑白照片并捕捉人物微表情,在短片《Love, Rendered》中重现了结婚 70 年的 Burt 和 Ethelle 未留影像的初遇记忆。该工作流结合图像恢复与姿态控制,将老年特征映射至年轻形象,旨在通过技术辅助认知衰退患者保留珍贵情感连接。
OpenAI 发布 ChatGPT Images 2.5,旨在将用户的想法、草图和参考照片转化为更具个性化和精致感的图像。该功能致力于生成更能准确反映用户意图的图片,提升创意表达效果。
Google 推出 Google Pics,这是一款基于 Nano Banana 模型构建的图像创建和编辑工具,正在向 Google AI Pro、Ultra 订阅用户及大多数 Workspace 商业客户逐步开放。
推荐理由:原文说明了基于 Nano Banana 模型的图片编辑能力以及直接嵌入 Workspace 应用的工作流变化,读者可据此评估其对现有设计协作流程的影响。
ComfyUI 宣布原生集成 Trellis.2 和 Pixal3D 两个开源 3D 生成模型,无需自定义节点或编译 CUDA 扩展即可运行。此次更新重构了 3D 工作流,新增 Load/Preview/Save 3D 节点及网格后处理功能,并移除了非商业许可依赖,支持在消费级硬件上免费进行包括商业用途在内的资产生成。
推荐理由:原生集成消除了编译依赖和许可限制,并配套完整的3D后处理节点,降低了本地高质量3D生成的门槛。
Comfy 宣布成为 MiniMax H3 商业许可证的首个官方经销商,支持本地商用。该许可涵盖视频、音频及音乐模型,允许 LoRA 训练与微调,并包含 Forward Deployed Creatives 专家服务。用户可通过 Comfy 获取专业版或企业版计划,实现从开源权重到合规商用的无缝衔接。
Google DeepMind 推出 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)和 Gemini Omni Flash(gemini-omni-flash-preview)两款新模型,现已在 Google AI Studio、Gemini API 和 Gemini Enterprise Agent Platform 上线。
推荐理由:原文给出了两款新模型的定价、延迟指标及 API 接入方式,读者可据此评估其在高吞吐图像生成与视频编辑工作流中的实际成本效益。