| 顺序 | 主题 | 要做什么 |
|---|---|---|
| 序 | 先回到个人作业一 | 复现范围、平台三个文件位与提交前检查 |
| 第一部分 | 看科研现场 分三小节 | 一 三个真实产品与案例:Claude Science、玻尔、Coscientist 二 自动化走到哪一步:Project APE、刷量的后果、三档自主程度 三 研究者怎么用:Goldsmith-Pinkham 的三件工作 |
| 第二部分 | 读懂一篇论文 | Han et al.(2024):研究问题与数据、三个发现、脱钩指标与 Table 1 |
| 第三部分 | 跑一遍回归 | 三种 Stata 接法;我们的复现工作区;用作者数据跑出整张 Table 1 |
| 第四部分 | 核对与拓展 | 与论文逐格对照;把样本拆成前后两期并检验差异;当堂练习 |
| 收尾 | 回到作业一 | 把方法迁移到个人作业一,延伸阅读与答疑 |
| 环节 | 具体要求 |
|---|---|
| 选文与取数 | 自选实证论文,先确认论文、数据和代码能合法取得;优先用公开数据 |
| 最低范围 | 核对样本与描述统计、核心结果,再核对一项稳健性或异质性结果 |
| 新增工作 | 完成最低范围后可做小拓展;补充公开数据或自己整理公开数据,按质量与可复现性加分 |
| 留痕 | 提交可重跑代码、运行说明、数据来源、原文对照与 AI 交互记录 |
| 截止 | 10 月 10 日 18:00,通过课程平台提交 |
| 文件位 | 放入什么 |
|---|---|
| 报告 PDF | 研究问题、数据与模型、原文对照、拓展解释;15 页是上限 |
| 展示页 zip | 现行表单要求所有人上传;展示页不超过 30 页 |
| 会话记录 zip | AI 交互记录;由于没有独立代码位,另放 do/py、README 和数据来源说明 |
跨论文、数据库和实验记录找线索,留下文献与数据的出处。
玻尔的科学导航面向这一环节。把模型放进真实软件环境执行,保留代码、输入、输出和审阅意见。
Claude Science 将多种工具接成工作台。已有研究让语言模型调用检索、代码和自动化设备完成化学实验步骤。
实验安全与结果确认仍由研究团队负责。左侧是分析结果,右侧并排代码、执行记录、消息、环境和审阅页签。
另设一个审查智能体,核对引用与计算,挑出引错的文献和对不上代码的图。
每张图附复现包,含生成它的代码、运行环境与完整消息记录。
边界:公开测试版,是应用不是新模型,目前主推生命科学,面向 macOS 与 Linux。
测试版预置六十多个面向科研的技能和连接器,覆盖基因组学、单细胞分析、蛋白组与化学信息学,首批重点在生命科学。
它可以调用计算环境,读文件、写脚本、生成图表并保留运行材料;也能通过 SSH 连到实验室自己的集群,访问新资源前会先征求用户同意。
经济学课堂的启发:我们也要把文献、数据、Stata 脚本和对照表放在同一条可复查的链上。
是什么。深势科技与北京科学智能研究院 2025 年 3 月发布的新版玻尔科研空间站,核心是「科学导航」:输入或选择一个科学问题,它解析问题意图、匹配相关成果、生成答案,并能一键跳到原始文献;整站覆盖读文献、做计算、做实验三段。
对我们最有用的部分。找文献与追踪进展:支持自然语言、图表与化学结构检索,可按关键词、期刊、学者订阅最新文章。
入口。bohrium.com,已接入 CARSI,用校园网身份就能登录。
边界。界面证明的是检索与整理能力,不等于 AI 完成了实验;答案旁的文献列表也不保证每句话都被准确支持,引用前要点开原文。
Anthropic 报告称,约 950 个智能体并行跑了 21 小时,从二十多万条逆转录酶里收敛到约二十个候选。
研究者随后做实验验证;实验室工作由人完成。
边界:这套系统的功能未知;没有证据表明它像 CRISPR 那样工作;预印本尚未同行评议,另外十次搜索都没再找到那段阵列。
Coscientist 把语言模型、科学检索、代码和自动化仪器连起来,在研究团队的环境中规划并执行化学反应步骤。
边界很清楚:设备在预设条件下执行步骤,实验板仍由人手动搬运,安全与结论由研究团队负责。
播放左侧视频,观察自然语言任务如何进入实验流程,以及哪些步骤仍由人核对。
苏黎世大学 Social Catalyst Lab 的实验项目,由 David Yanagizawa-Drott 主持。
用公开数据写原创实证论文:自己找问题、取数、选识别策略、写 R 脚本并成文。
截图上的四个数字:3,598 个选题、1,000 篇论文、18,000 多场比较、对人类论文胜率 5%。
官方自己写着:会有错误、幻觉和该扔掉的论文,未经同行评议,不能作为政策依据。
每篇 AI 论文与一篇即将发表于顶刊的人类论文配对,由模型读完两篇,判断哪一篇更好。每天比对 50 对。
担任评委的模型不是生成论文的那一家,避免自我偏好。每对交换顺序评两次,两次都赢才算赢;名次按累计胜场排定,单场胜负不改变位次。
评委只看到论文本身,拿不到代码和数据。它能判断文章读起来是否像一篇好论文,不能判断结果是否正确。
项目自己声明,这个名次是有噪声、可能有偏的信号,不是同行评议。两类论文用同一套分数衡量,人类顶刊论文整体排在 AI 论文之上。
| 环节 | 发生了什么 |
|---|---|
| 谁 | 芝加哥大学布斯商学院计量经济学与统计学教授 Nicholas Polson,终身教职 |
| 产出 | 2026 年到 8 月底,署名他的预印本账号上传 258 篇工作论文,其中 8 月一个月 104 篇;多数是二三十页以上的长文 |
| 怎么被发现 | 8 月 18 日 UCLA 的 Auyon Siddiq 发帖指出异常,经济学家 Jeremy Horpedahl 逐篇统计确认;随后这批论文从 SSRN 下架 |
| 作者怎么说 | 主要合作者 Vadim Sokolov 承认用了 AI,但否认「一句提示生成三十页」;他同时承认,AI 的参与程度没有在论文里一致披露 |
写代码、取数、画图交给它,问题怎么问、口径怎么定、结论成不成立由人判断。
今晚的 Stata 复现;Goldsmith-Pinkham 的两件工作。一次计算、一次实验、一版初稿可以由它跑完,交付之前与之后由人核对。
Claude Science 的工作台;Coscientist 按一句提示做完两个反应。人退到系统设计的位置,只在事后抽查结果。
Project APE 已经做到这一档;下一页还有一家公司想接着往下做。Jeff Dean 在谷歌近 27 年后离开,与 Sanjay Ghemawat、Oriol Vinyals、Quoc Le 创办 Discovery Loop(公益公司,Dean 任 CEO)。Alphabet 是创始投资人兼云服务方。
要做的正是上一档那件事:把科学方法本身自动化——提出实验、搭好条件、执行、评估,再跑上千遍;路线是先改进自己的模型,再扩到芯片设计、生物学、药物发现与材料。
投资人的说法:过去是人用 AI 做研究,现在要让 AI 当研究者。
他停在第 3 级:能读写文件、执行脚本、按报错自我调试,像一个住在电脑里的 RA。但 RA 交来的代码要验,它交来的结果也要验。
| 环节 | 发生了什么 |
|---|---|
| 问题 | 过去 50 年,美国住房自有率随年龄的分布怎么变;这是他本人研究的题目,与他和 Kelly Shue 关于住房回报的论文相关 |
| 起点与过程 | 只说清要什么数据,不说它在哪张表里;先试 FRED 卡在系列编号,普查局返回 403,它自己补上 user-agent 才下载成功 |
| 产出 | 找到两张普查表,按季度的一张从 1994 年起,按更细年龄组的一张从 1982 年起;解析多数据块与合并单元格后落成两个 CSV |
| 画图与结论 | 只给一句「照 Kieran Healy 的《Data Visualization》做」,它译成直接标注、少装饰与配色,写了 77 行 R,年份标签重叠也自己修好;2004 年住房自有率最高,2024 年与危机后时期相似 |
| 环节 | 发生了什么 |
|---|---|
| 问题 | 2025 年关税升级后,上市公司在 10-K 风险因素(Item 1A)里的关税表述有没有变化 |
| 前置与反问 | 先把 CIK、EDGAR 接口、每秒 10 次的限速与 User-Agent 要求讲清楚;它自己进入计划模式,反过来问数据库格式(选 DuckDB)、关键词策略和 User-Agent 用谁的身份 |
| 过程 | 480 行 Python;约 30 家公司 120 份 10-K;抽取从 112 份修到 119 份,剩下 1 份格式特殊,要人工处理 |
| 发现 | 2010 年 18 家公司共 25 段提到关税,2022–2025 年每家每年 26 到 35 段;词汇从 anti-dumping、countervailing duties 扩到 trade war、liberation day |
让 Claude Code 接入 IPO 与 CRSP 回报数据,生成脚本、表和初步解释。
随后检查频率、首日回报口径、代码和每个结果的来源,发现月度数据不能直接核对首日收益。
可迁移的习惯:把“完成速度”和“数值可信”分开检查。
样本怎么选、变量怎么构造、模型放了什么固定效应,都要从论文和代码里找出来。
先对样本量,再对系数和标准误;差异出现时,回查数据、变量和估计命令。
基准表跑通后,才知道改样本期或模型设定究竟改变了什么。
中美的技术联系有多紧密,两国政策让这种联系发生了什么变化,又怎样影响企业的创新与经营?
数据两条线。专利取自美国专利商标局与中国国家知识产权局的授权库,按专利之间的引用关系配对;企业取自 2007–2019 年两国上市公司财务数据,剔除金融业。
做法两步走。先用专利互引量出「脱钩」与「依赖」两个指标,再把指标接到企业年度面板上做回归。
2000–2021 年测得的脱钩程度持续下降;中国对美国的依赖约在 2009 年前后见顶,之后一路回落。
见下一页 Figure 4。脱钩之后,中国企业的创新产出显著上升(滞后一期系数 1.815),盈利和估值显著下降(ROIC −0.0804、Tobin’s Q −0.439),创新质量与 TFP 不显著。
这就是 Table 1,今晚复现的对象。2014 年后的斜率、以及几类特定技术领域的表现与全样本不同。原文用 Table 2 处理,本课不复现这一张。
讲课时一句带过,不展开。横轴:美国专利引用中国专利、相对引用本国专利的倾向p(美→中) = (n(美,中) ÷ x(中)) ÷ (n(美,美) ÷ x(美))
纵轴:中国专利引用美国专利、相对引用本国专利的倾向p(中→美) = (n(中,美) ÷ x(美)) ÷ (n(中,中) ÷ x(中))
n 是引用次数,x 是到当年为止该国授权的专利总数。除以 x 是为了不让两国专利数量的差距影响结果,否则量出来的只是谁专利多。
怎么读图。原点是两国互不引用,即完全脱钩;(1, 1) 是引用对方与引用本国一样频繁,即完全融合。把点投到 45° 对等线上:投到 (1, 1) 的距离是脱钩程度,离开对等线的垂直距离是依赖程度,落在上三角表示中国更依赖美国。
横轴是年份(2000–2021)。两条线各对一个纵轴:右轴是脱钩指标,左轴是依赖指标。
蓝线按右轴读。脱钩程度一路下降,说明两国的技术联系反而更紧了,与「正在脱钩」的直觉相反。
红线按左轴读。中国对美国的依赖先升后降,约在 2009 年见顶,此后持续回落。
虚线提醒。2003–2006 年引文数据不可靠,原文跳过这一段,不能拿它讲连续趋势。
| 层次 | 课堂要核对什么 |
|---|---|
| 技术联系 | 中美专利交叉引用,按技术类别和年份构造脱钩与依赖指标 |
| 企业结果 | 中国企业 2007–2019 年的创新产出、创新质量、TFP、ROIC 和 Tobin’s Q |
| 回归规格 | 企业固定效应、年份固定效应、企业控制变量;原文报告稳健标准误 |
| 可用数据 | 作者复现包含 WRDS、Compustat、CSMAR 订阅资料;教师机有授权副本 |
| 滞后一期脱钩 | 创新产出 | 创新质量 | TFP | ROIC | Tobin’s Q |
|---|---|---|---|---|---|
| 系数 | 1.815*** | 0.568 | 0.122 | −0.0804* | −0.439** |
| 稳健标准误 | 0.586 | 0.679 | 0.141 | 0.0429 | 0.207 |
| 企业年观测 | 14,739 | 14,739 | 14,739 | 14,739 | 14,739 |
人打开软件,输入命令或运行脚本。每一步看得见,适合初学、单步排错和核对原文。
依赖本机 Stata 授权与可访问的数据。skill 规定何时、怎样调用本地 Python 脚本;脚本把 do-file 交给 Stata。
适合已跑通、需要重复执行的固定流程。MCP 服务向智能体暴露运行工具。能力和权限取决于具体服务配置。
适合在已有受控服务的环境里跨工具编排。| 你现在的任务 | 合适入口 | 理由 |
|---|---|---|
| 第一次认识 Stata,或在查一条报错 | 软件界面 + do-file | 命令与输出同屏,容易定位是哪一行出了问题 |
| 同一张表要反复重跑、导出汇总 | skill / PyStata | 固定脚本和参数,能把执行步骤写成可重跑流程 |
| 已有可信 Stata MCP 服务,要和其他工具配合 | MCP | 通过统一工具接口调用;先确认它能做什么、能读哪些目录 |
| 动作 | 看到什么 |
|---|---|
| Windows 开始菜单搜 Stata | 打开已获授权的版本;教师机使用 Stata/MP 17 |
| Command 窗口 | 逐条输入命令;先检查目录、数据描述和一条回归 |
| Results / Variables | 查看样本量、系数、标准误及当前变量 |
| Do-file Editor | 打开 .do,逐段运行,保存修改后的可重跑版本 |
n_pat 是被解释变量;两段滞后脱钩指标是核心解释变量;i.year 和 firm_ID 对应两组固定效应。
先找 N=14,739,再找 1.815 和稳健标准误 0.586。对不上时回查样本、变量和命令。
智能体先读本地 skill.md,调用 run_stata.py -f <do-file>,PyStata 在本机启动授权的 Stata。
脚本只读入原始 .dta,输出聚合系数 CSV;输入文件不随会话上传。
智能体通过 MCP 的工具调用把命令交给已配置的 Stata 服务。具体能否读数据、运行 do-file,要看该服务暴露的工具和访问权限。
课堂不临时安装 MCP,也不假定所有服务接口一样。
复现包整体放在固定目录,不改动任何文件。
Table_1_Data.dta 一份数据,加作者原脚本与结果,作对照用。
按论文规格写 01_复现Table1.do,结果导出成可逐格对照的长表。
_src/L3复现Table1/;本机 Stata/MP 17 运行| 本机聚合结果 | 创新产出 | 创新质量 | TFP | ROIC | Tobin’s Q |
|---|---|---|---|---|---|
| 脱钩滞后 1 年 | 1.815 (0.586) | 0.568 (0.679) | 0.122 (0.141) | −0.0804 (0.0429) | −0.439 (0.207) |
| 脱钩滞后 2–3 年 | 0.811 (0.726) | 0.733 (0.799) | −0.330 (0.188) | −0.00601 (0.0541) | 0.150 (0.280) |
| 每列 N | 14,739 | 14,739 | 14,739 | 14,739 | 14,739 |
vce(robust) 标准误。上页原文 Table 1 是核对基准;本页数字来自原始数据的 5 次真实回归。| 对照维度 | 论文 Table 1 | 本机复现 |
|---|---|---|
| 系数(9 个变量 × 5 列) | 论文报告值 | 45 格全部一致 |
| 稳健标准误(同 45 格) | 括号内取值 | 全部一致 |
| 样本量(5 列) | 14,739 | 14,739 |
| 调整 R²(5 列) | 0.607 / 0.186 / 0.657 / 0.445 / 0.793 | 相同 |
结果/Table1_对比.md。Table_1_Results.txt;本机结果由 代码/03_对比与出表.py 生成,2026-09-30因变量、两段脱钩指标、控制变量、企业和年份固定效应、稳健标准误。
把样本期分为 2007–2013 和 2014–2019;分别记录 N、系数和标准误。
N=5,929;稳健标准误 1.068
N=8,810;稳健标准误 0.775
不能凭一组显著、一组不显著判断两期斜率不同
把包里的 pystata 拷到本机 skills 目录,重开会话让它生效。
用 Stata 自带数据跑一个回归,看它能不能把结果说清楚。
从作者包里挑出 Table 1 那几样,另建自己的目录,作者包只读。
自己写代码,逐格对上论文,再导成 RTF、Markdown 与 LaTeX。
| 顺序 | 产出 |
|---|---|
| 确认可行 | 论文、代码和公开数据能取得;写下核心表的样本与模型 |
| 完成复现 | 至少核对样本与描述统计、核心结果及一项稳健性或异质性结果 |
| 有余力再拓展 | 可补充公开数据或自己整理数据;说清新增工作、结果和局限 |
| 10 月 10 日 18:00 | 按平台现行三文件位提交报告、展示页和含代码的会话记录包 |
对话前 DeepMind 曹原:AI for Science 爆发,一个新时代到来了(硅谷 101 视频播客,1 小时 49 分;讲 Jeff Dean 出走、科研闭环、AI for AI 与自动实验室)
Project APE 的中文报道(2026 年 2 月,里面的产量与胜率是当时的数字)