0727

AI 资讯与研究

工作论文|调查与行政数据实证NBER·

工资暂未变化,工作内容已经改变

丹麦调查与行政记录显示,企业广泛引入聊天机器人,工作开始增加内容生成、AI 监督和系统整合等任务。双重差分估计在 ChatGPT 推出后两年内未发现显著平均收入或工时变化,并排除超过 2% 的效应。这是早期局部证据,不代表未来劳动市场不会受影响。

原文
研究报告|平台观察与测量框架Anthropic Research·

理解 AI 经济影响,要拆开哪些任务变量?

报告用任务复杂度、技能、用途、自主程度和成功情况五个维度描述 AI 使用,并将成功率纳入效率分析。它提示,相同职业标签下的任务可能差异很大,不能仅靠使用次数判断自动化程度。指标大量依赖模型对平台会话的估计,不能当成整个经济体的因果生产率测量。

原文
技术公告|机器人系统演示Google DeepMind·

从理解指令到协调身体,机器人还要跨过什么?

DeepMind 介绍 Gemini Robotics 2,将视觉语言理解、全身控制、灵巧操作和协作纳入机器人系统,并展示跨任务应用。案例把 AI 的边界从屏幕推进到物理环境。证据主要来自研发机构的演示与评测,不能据此认定开放现场的可靠性、安全性或商业效果已经普遍成立。

原文
期刊论文|概率天气模型回溯评测Nature·

天气预报中的 AI:预测可能性,而不只给一个答案

GenCast 用生成式模型给出多种可能的未来天气,形成最长 15 天的集合预报。在所测历史样本中,多项天气、气旋路径和风电指标优于比较基线。它为风险决策提供概率信息;回溯评测的优势不等于每次极端天气都能准确预报,仍需业务检验。

原文
期刊论文|企业分批部署实证研究The Quarterly Journal of Economics·

AI 进入客服:经验如何被分享,收益又落在谁身上?

基于一家企业 5,172 名客服的分批部署数据,AI 辅助使每小时解决问题数平均提高约 15%,新人和较低技能员工受益更多。资深员工的速度收益较小,部分质量指标略有下降。结果来自特定企业,不能直接推断整体就业或工资变化。

原文
期刊论文|预注册受控行为实验Nature Human Behaviour·

AI 的说服力与个人数据:更正后还剩哪些结论?

900 人的受控辩论实验中,获得个人资料的 GPT-4 比人类基线更有说服力。2026 年更正明确:它与未获得资料的 GPT-4 直接比较时,差异未达到统计显著,因此不能单独证明个性化带来额外优势。短期态度变化也不能直接推断真实平台中的长期影响。

原文
工作论文|全球职业暴露测量International Labour Organization·

职业暴露度,为什么不等于岗位消失率?

ILO 结合任务数据、从业者判断、专家意见和模型评分,更新全球职业暴露指数。约四分之一劳动者处于具有一定生成式 AI 暴露度的职业,文职任务暴露较高。指数衡量技术可能接触哪些任务,不预测实际裁员数量;工作重组与完整替代须区分。

原文
年度报告|跨学科证据综述International AI Safety Report·

AI 能力快速变化,治理如何面对证据不足?

报告综合通用 AI 的能力、风险与管理研究,区分已有记录的伤害和仍不确定的潜在风险。核心难题是能力增长快于可靠证据积累:过早干预可能无效,等待定论也可能错过应对时机。这是一份证据综述,不能把不同风险情景都写成必然结果。

原文
期刊论文|人群筛查随机非劣效试验The Lancet·

AI 辅助乳腺筛查:效率需要与后续结果一起看

瑞典约 10.6 万名女性参与的随机试验中,AI 辅助筛查提高了敏感度、保持相近特异度,并减少阅片负担。后续间期癌发生率满足非劣效标准,但组间下降未达到统计显著。研究评价的是特定筛查流程,尚不等于证明死亡率下降或可完全取消医生阅片。

原文
期刊论文|教育现场实验PNAS·

做题更顺利,是否意味着真正学会?

近千名高中生的数学现场实验中,普通 GPT 界面和教学约束版均提高练习表现;撤去工具后,普通界面组的独立答题表现反而较差,教学约束明显缓解了这种影响。工具如何引导练习,会改变短期学习结果;不能将其外推为所有课程的长期影响。

原文
保持好奇,下次再读。

审核通过后,一起交流。

评论、回复和留言,仅向审核通过并登录的共建者开放。

  1. 提交共建资料
  2. 等待资料审核
  3. 审核通过,登录后参与
已加入,前往登录成为共建者当前为流程预览,账号登录与审核放行尚未接入。