Ideogram 发布 Ideogram 4.5 图像模型,主打局部编辑不影响画面其余部分
Ideogram 发布新模型 Ideogram 4.5,声称编辑图像局部时不会破坏其余部分,只改动用户指定的区域。模型提供四档质量,价格从每张 0.8 到 22 美分,均为原生 2K 分辨率,现已上线 Ideogram 平台和 API,合作方包括 Picsart、Runway、Pika 和 Leonardo AI,开源权重版本也将推出。
Ideogram 发布新模型 Ideogram 4.5,声称编辑图像局部时不会破坏其余部分,只改动用户指定的区域。模型提供四档质量,价格从每张 0.8 到 22 美分,均为原生 2K 分辨率,现已上线 Ideogram 平台和 API,合作方包括 Picsart、Runway、Pika 和 Leonardo AI,开源权重版本也将推出。
TypeSafe AI 上周发布 Jev,作者称其为 System One 或决策模型:接受文本输入但输出对应类别、是非题和评分的浮点数及置信度。定价只按输入 token 计费,为 $0.042/百万 token,低于 GPT-5 Nano 的 $0.05,适合分类、排序和搜索重排,作者同时提醒其黑箱性和潜在偏差风险。
GPT‑5.6 现已在 Kiro 中可用,帮助开发者更高效地规划、构建、审查和测试软件,并提供更好的价格性能比。
NVIDIA 发布 Magpie TTS Multilingual,364M 参数开源权重模型,新增现代标准阿拉伯语、韩语和巴西葡萄牙语,共支持 12 种语言。
Google DeepMind 发布 Gemini Robotics 2,包含 VLA 模型 Gemini Robotics 2、具身推理模型 Gemini Robotics ER 2 和端侧模型 Gemini Robotics On-Device 2,实现全身控制、精细操作和多机器人协作。
推荐理由:官方发布同时给出三个模型的分工、适配速度数字和安全基准,读者可以据此评估具身智能模型进入全身控制和多机协作的实际进展。
NVIDIA 发布 Cosmos-H-Dreams,一个动作条件驱动的手术机器人实时生成式仿真器,将 Cosmos-H-Surgical-Simulator 蒸馏为因果、少步数的学生模型,并通过 FlashDreams 流式推理库在单张 NVIDIA RTX PRO 6000 上从约每秒10帧提升到约160帧的交互运行。
Google DeepMind 发布音频模型 Gemini 3.5 Live Translate,提供 70+ 语言的近实时语音到语音翻译,自动检测语言并保留说话者的语调、节奏和音高,全程仅落后说话者数秒。
推荐理由:官方发布正文给出了 70+ 语言、延迟表现和多端开放入口,读者可据此评估它在通话、会议和翻译场景的可用性。
Mistral AI 发布 Codestral 25.08,并整合 Codestral Embed、Devstral 和 Mistral Code IDE 插件形成面向企业的完整编码栈。