跳到正文

全部动态

今日 1 条
7月1日周三
6月30日周二
6月29日周一
  1. Import AI50

    Import AI 463:NVIDIA 打造自我改进机器人框架 ENPIRE;万字中国 GPU 集群;人类时代的挽歌

    NVIDIA 研究人员开发 ENPIRE 框架,让物理机器人像编码智能体一样自主实验与迭代改进策略。系统用两台 YAM 机械臂和 RTX 5090 工作站组成闭环,自动评估与重置场景,GPT-5.5(Codex)和 Opus 4.7(Claude Code)表现最佳,在 PushT 等灵巧操作任务上达到 99% 成功率,8 个智能体并行有时获得更高分数。

6月25日周四
6月24日周三
6月22日周一
6月19日周五
6月13日周六
6月11日周四
6月8日周一
  1. Google DeepMind62

    Google DeepMind 报告塞拉利昂 Guided Learning 试验:Gemini 辅助数学学习提升约 1.2 至 1.7 年学习进度

    Google DeepMind 发布在塞拉利昂开展的预注册 RCT 结果,使用 Guided Learning 的学生数学成绩较对照组提升 +0.258 个标准差,约合 1.2 至 1.7 年常规学习进度;教师将 Gemini 融入约半数课时(目标 12 小时)的班级提升更高,约 1.8 至 2.5 年。

    推荐理由:原文给出了预注册 RCT 的量化结果和交互数据,读者可以据此评估 AI 辅助教学在真实课堂中的效果与局限。

6月5日周五
  1. Google Research67

    Google 发布 PHRM 系统,用手机前摄在日常使用中被动监测心率与静息心率

    Google 在 Nature 发表 PHRM 研究系统,利用人脸解锁后的前摄视频,通过深度学习在后台估计心率,相比 ECG 的 MAPE 为 6.09%,日静息心率相对 Fitbit Charge 6 的 MAE 为 4.39 bpm。研究覆盖近 700 名不同肤色参与者,是迄今最大规模的 rPPG 研究,并公开发布数据集与预训练 PHRM-mini 模型供合格研究者申请使用。

    推荐理由:原文给出跨肤色验证数据与免费开放的数据集和模型入口,研究者可以据此评估rPPG方法的可复用性。

5月29日周五
5月28日周四
5月18日周一
5月12日周二
5月6日周三
4月30日周四
  1. Google Research62

    Google Research 展示科学家使用 Empirical Research Assistance 的四个科研方向

    Google Research 介绍自 9 月预印本发布 Empirical Research Assistance(ERA)以来,其科学家与学术合作者将其应用于真实科研的四个成果。

    推荐理由:文章展示了 ERA 在疫情预测、宇宙学、气候遥感和神经回路四个真实科研场景的应用结果,可了解 LLM 辅助科研的具体形态。

4月22日周三
4月21日周二
  1. Hugging Face Blog46

    QIMMA:一个质量优先的阿拉伯语 LLM 排行榜

    Hugging Face 推出 QIMMA(قِمّة,意为“峰顶”),先对基准做质量校验再评估模型,确保分数反映真实的阿拉伯语能力。QIMMA 整合 14 个基准的 109 个子集、超 52,000 样本,覆盖文化、STEM、法律、医疗、安全、文学和代码 7 个领域,99% 为原生阿拉伯语内容。

4月20日周一
  1. Berkeley AI Research44

    Berkeley AI Research 提出 GRASP:面向更长时程世界模型的梯度规划方法

    Berkeley AI Research 提出 GRASP,一种基于梯度的世界模型规划器,让长时程规划更稳定可靠。其核心做法有三点:把轨迹提升到虚拟状态使优化在时间上并行、在状态迭代中直接引入随机性以实现探索、重塑梯度让动作获得干净的信号并避开脆弱的“状态-输入”梯度。

4月16日周四
4月15日周三
4月9日周四
4月3日周五
4月1日周三
3月26日周四
  1. Google DeepMind60

    Google DeepMind 发布衡量 AI 有害操纵的实证评估工具包

    Google DeepMind 发布关于 AI 有害操纵的新研究,称建立了首个经实证验证的评估工具包,用于测量 AI 以负面和欺骗性方式改变人类思想与行为的能力,并公开运行人类被试研究所需的全部材料。

    推荐理由:原文给出覆盖三国万余名参与者的实验设计和效能与倾向双维度框架,为理解和测量 AI 有害操纵风险提供了可复用的方法入口。

3月25日周三
  1. Google Research43

    Google Research 推出 S2Vec:用自监督嵌入学习城市建成环境的“语言”

    Google Research 在 Earth AI 计划下推出 S2Vec,一个自监督框架,将建成环境栅格化为多层级特征图像,再用 masked autoencoding 学习通用地理位置嵌入。评测显示 S2Vec 在零样本地理外推任务(如全美人口密度、中位收入预测)上通常是表现最好的单一模型,与图像嵌入做多模态融合后整体优于任一单一模态,但在树冠覆盖、海拔等环境类任务上仍需改进。

3月24日周二
3月18日周三
  1. Google Research76

    Google Research 发表两项 Nature Cancer 研究,评估 AI 辅助英国 NHS 乳腺癌筛查工作流

    Google Research 联合多家 NHS 机构开展 AIMS 研究,在 Nature Cancer 发表两项研究评估 AI 乳腺癌检测系统。

    推荐理由:两项 Nature Cancer 研究同时给出大规模独立性能数据和真实双读工作流对比,读者能看到 AI 替代第二阅片人的收益与人工仲裁推翻 AI 的具体代价。

3月17日周二
3月13日周五
  1. Berkeley AI Research47

    SPEX 与 ProxySPEX:如何大规模识别 LLM 的关键交互

    Berkeley AI Research 提出可在大规模下识别关键交互的 SPEX 与 ProxySPEX 算法,通过消融实验解释 LLM 行为。SPEX 利用稀疏性和低度性将交互发现转化为稀疏恢复问题,规模较此前方法提升数个数量级;ProxySPEX 进一步利用层级结构,以约 10x 更少的消融达到与 SPEX 相当的性能。二者可用于特征归因、数据归因和模型组件归因。

3月12日周四
  1. Google Research64

    Google AMIE 完成真实门诊前瞻性可行性研究

    Google 与 Beth Israel Deaconess Medical Center 合作完成 AMIE 的前瞻性单中心可行性研究,100 名成人患者在门诊就诊前与 AMIE 进行问诊对话,由医生实时监督,全程未触发任何安全中止。

    推荐理由:原文给出真实门诊环境下的安全性、诊断与患者反馈数据,读者可以据此评估对话式医疗 AI 落地临床的现状与局限。

3月7日周六
  1. Google Research50

    Google Research 发布非洲语言开放语音语料库 WAXAL

    Google Research 推出大规模开放语音数据集 WAXAL,覆盖撒哈拉以南非洲 27 种语言、超过 1 亿使用者。首批包含约 1,846 小时转写自然语音(WAXAL-ASR,采用图像提示引发自发话语)和 565 小时以上高保真 TTS 录音,以 CC-BY-4.0 许可发布,由 Makerere 大学、加纳大学等非洲机构主导采集,后续计划持续扩展语言。