Berkeley 团队用 K-Search 将 CUDA 内核优化经验迁移到 Apple Silicon 的 MLX
IBM Research 与 UC Berkeley Sky Lab 基于开源 K-Search 框架构建结构化 CUDA 到 MLX 翻译层,用演化搜索为 Apple Silicon 生成高质量内核。
IBM Research 与 UC Berkeley Sky Lab 基于开源 K-Search 框架构建结构化 CUDA 到 MLX 翻译层,用演化搜索为 Apple Silicon 生成高质量内核。
UC Berkeley BAIR 团队提出 ABBEL 框架,用自然语言信念状态替代完整交互历史作为 LLM 智能体的工作上下文,并通过 belief grading 监督摘要内容。
Jack Clark 主持的 Import AI 第 464 期汇总:Fable 在 KernelBench-Mega 上以 CUDA 代码取得 18.71X 加速。
Hugging Face 推出开源基准 ScarfBench,用 Spring、Jakarta EE、Quarkus 间的迁移任务评测 AI 智能体,包含 34 个应用、102 个框架实现、204 个迁移任务、约 151K 行代码和 1,331 个专家编写测试。
OpenAI 举办 Parameter Golf 活动,汇聚 1000+ 参与者和 2000+ 提交作品,探索 AI 辅助机器学习研究。活动在严格约束下覆盖 coding agents、量化和新型模型设计等方向。
OpenAI 与 Paradigm 联合推出 EVMbench,一个评估 AI 智能体能否检测、修补和利用高危智能合约漏洞的评测基准。该基准聚焦智能体在智能合约安全场景下的实际能力。
BigCode 发布 BigCodeArena,一个通过真实执行来评判代码生成模型的人类投票平台,支持 10 种语言和 8 种执行环境,开放无需注册。上线 5 个月收集 14K 对话、4700+ 偏好投票,Elo 排名中 o3-mini 和 o1-mini 居首。
推荐理由:基于5个月社区执行评估数据发布代码生成评测平台,给出分语言和执行环境的模型表现差异与两个新基准。
Hugging Face 推出 3LM,首个针对阿拉伯语 LLM 评测 STEM 与代码生成的多组件基准,包含 865 道原生 STEM 选择题、1,744 道合成高难度题,以及由 HumanEval+ 和 MBPP+ 翻译的阿拉伯语代码数据集。
Hugging Face 在 Open R1 第三次更新中发布了从 DeepSeek-R1 蒸馏的 CodeForces-CoTs 数据集(近 10 万样本)、2024 年 IOI 题目构成的 IOI 基准,以及基于 Qwen2.5 Coder 微调的 OlympicCoder-7B 和 OlympicCoder-32B。
推荐理由:Hugging Face 官方复盘训练过程,给出样本打包、学习率等可复用经验,并附带完整数据集、基准和评测代码。
OpenAI 推出 SWE-Lancer 基准,将真实自由职业软件工程任务转化为 LLM 评测,总价值 100 万美元,考察前沿模型能否赚取这笔报酬。该基准用真实 Upwork 工程任务衡量模型的实际编程能力。
OpenAI 发布 SWE-bench 的人工验证子集 SWE-bench Verified,用于更可靠地评估 AI 模型解决真实软件问题的能力。
Hugging Face 发布 BigCodeBench,用于在无污染的实际编程任务上评估大语言模型,定位为 HumanEval 的新一代继任者。
Meta 发布开源评测框架 CyberSecEval 2,用于评估 LLM 在生成不安全代码、提示词注入、协助网络攻击、代码解释器滥用和自动化攻击能力等方面的安全风险。评测显示,LLM 平均协助网络攻击的合规率已从上一版的 52% 降至 28%;提示词注入防护仍未解决,模型在端到端漏洞利用上能力有限。全部代码开源,并提供 leaderboard,欢迎社区贡献。
UC Berkeley、MIT 和 Cornell 研究者推出 LiveCodeBench 排行榜,通过从 LeetCode、AtCoder、CodeForces 收集并标注发布日期的题目,检测并防止 benchmark 污染。
Hugging Face 发布开源数据集 WebSight,用于训练视觉语言模型将网页截图转换为 HTML 代码。其最新版 WebSight-v0.2 扩展至 200 万个样本,改用真实图像和 Tailwind CSS。基于该数据集微调的模型 Sightseer 可将截图转为可运行的 HTML,并能在生成代码中嵌入与原图相近的图像。
OpenAI 发表论文《Evaluating large language models trained on code》,主题为评估基于代码训练的大语言模型。抓取仅获取到标题,正文内容不可用。