这是一个围绕“雅鲁藏布江下游水电工程是否带动企业注册活力”所搭建的复现与分析仓库。项目以西藏企业注册数据为基础,结合空间暴露分组、双重差分(DID)、事件研究、稳健性检验和异质性分析,输出论文写作可直接使用的图表与诊断表。

- 整理和合并天眼查导出的西藏企业注册数据
- 构建
2020-01到2025-09的县级月度平衡面板 - 以工程走廊距离划分处理组、排除组和对照组
- 运行基准 DID、事件研究、稳健性检验、异质性分析
- 导出图表、回归结果和辅助诊断表
当前主程序 did_model.py 默认使用 project_corridor 口径:
- 政策冲击时点:
2021-03 - 时间范围:
2020-01至2025-09 - 疫情极端月份剔除:
2020-02、2020-03、2020-04 - 处理组:
米林县、墨脱县、林芝县 - 排除组:
波密县、工布江达县 - 对照组:
察隅县、边坝县、嘉黎县、洛隆县、八宿县、朗县、比如县、索县、隆子县、丁青县、加查县
空间分组逻辑来自 map_did.py:
0-30km:核心处理县30-80km:潜在外溢排除县80-200km:低暴露对照县
此外,did_model.py 中还保留了 broad_basin、core_corridor 等备选口径,可通过修改 ACTIVE_PROFILE_KEY 切换。
did_model.py:主分析脚本,负责数据读取、面板构建、回归、绘图与导出map_did.py:工程走廊暴露分组与空间分布图生成county_utils.py:区县名称标准化工具单文件数据导入.py:合并多个天眼查 Excel,并统一日期格式天眼查爬虫.py:Selenium 爬虫脚本,用于分月抓取企业数据test_did_model.py:单元测试,锁定样本口径、关键参数和绘图行为did_output/:分析结果输出目录data/:原始数据压缩包或备份仿真/:地图底图、河流分级图层和区县边界数据docs/plans/:开发计划与过程记录
建议环境:
- Windows
- Python
3.10+
核心依赖:
pip install pandas numpy matplotlib statsmodels geopandas shapely openpyxl selenium说明:
- 若只运行主分析,不使用爬虫,则
selenium不是必须。 - 若只做数据合并,不需要安装
geopandas和shapely。 - Windows 下安装
geopandas若遇到编译问题,建议使用 Conda 环境。 - 绘图脚本默认使用中文字体
SimHei,本机缺失时可能出现中文乱码或方块字。
主分析脚本默认读取仓库根目录下的:
西藏企业数据.xlsx
该文件已被 .gitignore 忽略,通常不会提交到仓库。运行前请确认它位于项目根目录。
如果你手头是多个天眼查导出的 Excel,可以先在项目根目录执行:
python 单文件数据导入.py这个脚本会:
- 读取已有的
西藏企业数据.xlsx - 合并当前目录下以
【天眼查】开头的 Excel 文件 - 去重并标准化“成立日期”
- 输出
合并_所有企业数据_日期格式.xlsx
python did_model.py主程序会依次执行:
- 数据清洗
- 月度面板构建
- 描述统计
- 基准 DID
- 事件研究和平行趋势检验
- 稳健性检验
- 异质性分析
- 空间分布图绘制
- CSV 与图片导出
python map_did.pypython -m unittest -v test_did_model.py运行 did_model.py 后,结果默认写入 did_output/。
主要图片包括:
fig1_事件研究图.pngfig2_月度趋势图.pngfig3_系数汇总图.pngfig4_异质性分析图.pngfig5_空间分布图.png
主要表格包括:
01_月度面板数据.csv02_回归结果汇总.csv03_事件研究系数.csv04_组别前后对比.csv05_年度差距分解.csv06_县级贡献分解.csv07_行业门类影响因子.csv08_行业大类影响因子.csv09_时间窗口影响因子.csv
did_model.py 的核心思路如下:
- 读取企业注册明细并统一县名
- 仅保留样本县和研究期内数据
- 按县 × 月构建平衡面板
- 使用
treat × post构造 DID 变量 - 用双向固定效应模型估计注册活力变化
- 用事件研究检查处理前趋势
- 从空间、行业、时间三个维度做异质性比较
天眼查爬虫.py目前写死了本地路径,例如E:\工具\chromedriver.exe和C:\Users\Wu\Desktop\数据收集,直接运行前需要先按本机环境修改。map_did.py依赖仿真/目录下的 GeoJSON、Shapefile 和河流图层,目录名与文件名不要随意变动。- 若只想复现实证结果,优先使用已有的
西藏企业数据.xlsx和did_model.py,不必先跑爬虫。 - 如果需要切换研究口径,可在
did_model.py中修改ACTIVE_PROFILE_KEY。
主分析脚本注释中注明的参考框架为:
- The Growth Tide: Quasi-Experimental Evidence on the Regional Economic Impacts of Mega-Dams
如果后续还要继续完善,比较自然的下一步通常是补一个 requirements.txt 或 environment.yml,把当前环境固定下来,便于复现。