工资暂未变化,工作内容已经改变
丹麦调查与行政记录显示,企业广泛引入聊天机器人,工作开始增加内容生成、AI 监督和系统整合等任务。双重差分估计在 ChatGPT 推出后两年内未发现显著平均收入或工时变化,并排除超过 2% 的效应。这是早期局部证据,不代表未来劳动市场不会受影响。
丹麦调查与行政记录显示,企业广泛引入聊天机器人,工作开始增加内容生成、AI 监督和系统整合等任务。双重差分估计在 ChatGPT 推出后两年内未发现显著平均收入或工时变化,并排除超过 2% 的效应。这是早期局部证据,不代表未来劳动市场不会受影响。
报告用任务复杂度、技能、用途、自主程度和成功情况五个维度描述 AI 使用,并将成功率纳入效率分析。它提示,相同职业标签下的任务可能差异很大,不能仅靠使用次数判断自动化程度。指标大量依赖模型对平台会话的估计,不能当成整个经济体的因果生产率测量。
DeepMind 介绍 Gemini Robotics 2,将视觉语言理解、全身控制、灵巧操作和协作纳入机器人系统,并展示跨任务应用。案例把 AI 的边界从屏幕推进到物理环境。证据主要来自研发机构的演示与评测,不能据此认定开放现场的可靠性、安全性或商业效果已经普遍成立。
GenCast 用生成式模型给出多种可能的未来天气,形成最长 15 天的集合预报。在所测历史样本中,多项天气、气旋路径和风电指标优于比较基线。它为风险决策提供概率信息;回溯评测的优势不等于每次极端天气都能准确预报,仍需业务检验。
基于一家企业 5,172 名客服的分批部署数据,AI 辅助使每小时解决问题数平均提高约 15%,新人和较低技能员工受益更多。资深员工的速度收益较小,部分质量指标略有下降。结果来自特定企业,不能直接推断整体就业或工资变化。
900 人的受控辩论实验中,获得个人资料的 GPT-4 比人类基线更有说服力。2026 年更正明确:它与未获得资料的 GPT-4 直接比较时,差异未达到统计显著,因此不能单独证明个性化带来额外优势。短期态度变化也不能直接推断真实平台中的长期影响。
ILO 结合任务数据、从业者判断、专家意见和模型评分,更新全球职业暴露指数。约四分之一劳动者处于具有一定生成式 AI 暴露度的职业,文职任务暴露较高。指数衡量技术可能接触哪些任务,不预测实际裁员数量;工作重组与完整替代须区分。
报告综合通用 AI 的能力、风险与管理研究,区分已有记录的伤害和仍不确定的潜在风险。核心难题是能力增长快于可靠证据积累:过早干预可能无效,等待定论也可能错过应对时机。这是一份证据综述,不能把不同风险情景都写成必然结果。
瑞典约 10.6 万名女性参与的随机试验中,AI 辅助筛查提高了敏感度、保持相近特异度,并减少阅片负担。后续间期癌发生率满足非劣效标准,但组间下降未达到统计显著。研究评价的是特定筛查流程,尚不等于证明死亡率下降或可完全取消医生阅片。
近千名高中生的数学现场实验中,普通 GPT 界面和教学约束版均提高练习表现;撤去工具后,普通界面组的独立答题表现反而较差,教学约束明显缓解了这种影响。工具如何引导练习,会改变短期学习结果;不能将其外推为所有课程的长期影响。