跳到正文

#论文/研究

今日 0 条
7月9日周四
7月8日周三
7月1日周三
6月30日周二
6月25日周四
6月19日周五
6月16日周二
6月13日周六
6月11日周四
6月8日周一
  1. Google DeepMind62

    Google DeepMind 报告塞拉利昂 Guided Learning 试验:Gemini 辅助数学学习提升约 1.2 至 1.7 年学习进度

    Google DeepMind 发布在塞拉利昂开展的预注册 RCT 结果,使用 Guided Learning 的学生数学成绩较对照组提升 +0.258 个标准差,约合 1.2 至 1.7 年常规学习进度;教师将 Gemini 融入约半数课时(目标 12 小时)的班级提升更高,约 1.8 至 2.5 年。

    推荐理由:原文给出了预注册 RCT 的量化结果和交互数据,读者可以据此评估 AI 辅助教学在真实课堂中的效果与局限。

6月5日周五
  1. Google Research67

    Google 发布 PHRM 系统,用手机前摄在日常使用中被动监测心率与静息心率

    Google 在 Nature 发表 PHRM 研究系统,利用人脸解锁后的前摄视频,通过深度学习在后台估计心率,相比 ECG 的 MAPE 为 6.09%,日静息心率相对 Fitbit Charge 6 的 MAE 为 4.39 bpm。研究覆盖近 700 名不同肤色参与者,是迄今最大规模的 rPPG 研究,并公开发布数据集与预训练 PHRM-mini 模型供合格研究者申请使用。

    推荐理由:原文给出跨肤色验证数据与免费开放的数据集和模型入口,研究者可以据此评估rPPG方法的可复用性。

5月28日周四
5月16日周六
4月30日周四
  1. Google Research62

    Google Research 展示科学家使用 Empirical Research Assistance 的四个科研方向

    Google Research 介绍自 9 月预印本发布 Empirical Research Assistance(ERA)以来,其科学家与学术合作者将其应用于真实科研的四个成果。

    推荐理由:文章展示了 ERA 在疫情预测、宇宙学、气候遥感和神经回路四个真实科研场景的应用结果,可了解 LLM 辅助科研的具体形态。

4月25日周六
  1. OpenAI News43

    OpenAI 构建 AI 就业转型模型

    OpenAI 发布一个新的分析框架,评估 921 种职业和 1.48 亿个美国就业岗位,识别哪些岗位面临自动化风险、重组、增长或受 AI 影响较小。该框架为理解 AI 对就业的过渡期影响提供依据。

4月22日周三
4月20日周一
  1. Berkeley AI Research44

    Berkeley AI Research 提出 GRASP:面向更长时程世界模型的梯度规划方法

    Berkeley AI Research 提出 GRASP,一种基于梯度的世界模型规划器,让长时程规划更稳定可靠。其核心做法有三点:把轨迹提升到虚拟状态使优化在时间上并行、在状态迭代中直接引入随机性以实现探索、重塑梯度让动作获得干净的信号并避开脆弱的“状态-输入”梯度。

4月16日周四
4月9日周四
4月3日周五
4月1日周三
  1. Hugging Face Blog62

    TII 发布 Falcon Perception 0.6B 早融合感知模型及 0.3B Falcon OCR

    TII Falcon Vision 团队发布 Falcon Perception,一个 0.6B 参数的早融合 Transformer,用混合注意力掩码处理图像块与文本,做自然语言提示的开放词汇定位与分割,在 SA-Co 上达到 68.0 Macro-F1(SAM 3 为 62.3),但在 presence calibration 上落后(MCC 0.64 vs 0.82)。

    推荐理由:TII 自述用单一早融合 Transformer 做开放词汇感知,读者可以看到架构、数据配方和 SA-Co 与 PBench 上的具体对比依据。

3月25日周三
  1. Google Research43

    Google Research 推出 S2Vec:用自监督嵌入学习城市建成环境的“语言”

    Google Research 在 Earth AI 计划下推出 S2Vec,一个自监督框架,将建成环境栅格化为多层级特征图像,再用 masked autoencoding 学习通用地理位置嵌入。评测显示 S2Vec 在零样本地理外推任务(如全美人口密度、中位收入预测)上通常是表现最好的单一模型,与图像嵌入做多模态融合后整体优于任一单一模态,但在树冠覆盖、海拔等环境类任务上仍需改进。

3月24日周二
3月18日周三
  1. Google Research76

    Google Research 发表两项 Nature Cancer 研究,评估 AI 辅助英国 NHS 乳腺癌筛查工作流

    Google Research 联合多家 NHS 机构开展 AIMS 研究,在 Nature Cancer 发表两项研究评估 AI 乳腺癌检测系统。

    推荐理由:两项 Nature Cancer 研究同时给出大规模独立性能数据和真实双读工作流对比,读者能看到 AI 替代第二阅片人的收益与人工仲裁推翻 AI 的具体代价。

3月17日周二
3月13日周五
  1. Berkeley AI Research47

    SPEX 与 ProxySPEX:如何大规模识别 LLM 的关键交互

    Berkeley AI Research 提出可在大规模下识别关键交互的 SPEX 与 ProxySPEX 算法,通过消融实验解释 LLM 行为。SPEX 利用稀疏性和低度性将交互发现转化为稀疏恢复问题,规模较此前方法提升数个数量级;ProxySPEX 进一步利用层级结构,以约 10x 更少的消融达到与 SPEX 相当的性能。二者可用于特征归因、数据归因和模型组件归因。

3月12日周四
  1. Google Research64

    Google AMIE 完成真实门诊前瞻性可行性研究

    Google 与 Beth Israel Deaconess Medical Center 合作完成 AMIE 的前瞻性单中心可行性研究,100 名成人患者在门诊就诊前与 AMIE 进行问诊对话,由医生实时监督,全程未触发任何安全中止。

    推荐理由:原文给出真实门诊环境下的安全性、诊断与患者反馈数据,读者可以据此评估对话式医疗 AI 落地临床的现状与局限。

3月5日周四
  1. Google Research48

    Google Research:教 LLM 像贝叶斯派一样推理

    Google Research 通过“Bayesian teaching”监督微调,让 LLM 模仿 Bayesian Assistant 的最优贝叶斯推理预测,弥补其默认简单启发式的不足。在简化航班推荐任务中,各系列 LLM 原本表现明显差于 Bayesian Assistant,且常在单轮交互后停滞;训练后不仅显著提升推荐任务表现,还能泛化到其他任务。

3月4日周三