OpenAI News·· 2025-02-18AI 评分35
OpenAI 推出 SWE-Lancer 基准:测试前沿 LLM 能否靠真实自由软件工程赚 100 万美元
Introducing the SWE-Lancer benchmark
AI 导读
OpenAI 推出 SWE-Lancer 基准,将真实自由职业软件工程任务转化为 LLM 评测,总价值 100 万美元,考察前沿模型能否赚取这笔报酬。该基准用真实 Upwork 工程任务衡量模型的实际编程能力。
来源:OpenAI News · openai.com