Claude Opus 5.5 擅长制作解释视频
Claude Opus 5.5 本周发布,社区反响热烈,尤其被认为擅长制作解释视频。它在 SimpleBench 上以 88.4% 领跑,视觉评测被评为 Anthropic 迄今最佳视觉模型,成本比 Fable 5.1 低约 60%。此外,GPT-6 系列、Gemini 3.8 Flash、小米 MiMo-V2.6-Pro(MIT 开源、1M 上下文)等同周亮相。
Claude Opus 5.5 本周发布,社区反响热烈,尤其被认为擅长制作解释视频。它在 SimpleBench 上以 88.4% 领跑,视觉评测被评为 Anthropic 迄今最佳视觉模型,成本比 Fable 5.1 低约 60%。此外,GPT-6 系列、Gemini 3.8 Flash、小米 MiMo-V2.6-Pro(MIT 开源、1M 上下文)等同周亮相。
Basis 使用 GPT-6 Astra 完成 50 个工作表(tab)的报税工作簿,速度是 GPT-5.6 Sol 的 2 倍。GPT-6 Astra 对用户意图的理解更强,让 Basis 在实际使用中更有信心。
NVIDIA Vera Rubin NVL72 首次参加 MLPerf Inference v6.1 预览提交即取得领先性能:在 Qwen3-VL 上吞吐量最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上使用 TensorRT-LLM 最高达 2.5 倍。
Google DeepMind 推出针对专有前沿模型的首个双盲评测,将外部评测限制在密码学安全的“盒子”环境中,防止模型提前看到测试题导致基准污染。此次与 Singapore AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作,对一个 Gemini Flash Lite 模型在隐私保护环境下测试机密基准。
OpenAI 发布 GPT-5 首次上手视频,展示多位领先开发者首次使用 GPT-5 的过程与反应。