Tomme
目录
← 返回全部项目

上市公司研发投入与专利数据整合

如何把来源和表头都不一致的研发投入、上市公司与专利数据整理成可分析的公司—年度面板?

多源数据清洗 × 匹配验证

问题最初是怎样展开的

研发投入、上市公司和专利数据来自不同文件,表头可能出现在不同位置,年份和公司名称也不完全统一。手工修一份表并不难,麻烦在于下一年、下一批文件还会出现新的“只差一点”。如果规则只对当前文件有效,合并完成也不能算真正完成。

哪些发现改变了原来的方案

我把表头位置、字段别名和匹配键整理成可识别规则,优先使用证券代码与年份连接,同时把重复键、缺失值、匹配率和未匹配记录单独输出。这样做以后,结果不再只有一张合并表,还能看见哪些数据没有进入分析,以及损失发生在哪里。

这个项目处理了哪些具体工作

针对多文件、多表头和命名不统一问题,自动识别表头与字段,按证券代码和年份完成匹配,并对重复、缺失和匹配率进行验证。公开仓库使用合成样例,保护原数据授权。

我在项目中负责哪些判断

个人完成。本人定义匹配键、数据质量规则与输出结构,审核自动识别结果并完成最终验证。

4.85万专利记录
2.16万匹配研发记录
12年2010—2021覆盖
双键证券代码×年份

项目经历了哪些阶段

1

文件盘点

识别不同年份、不同来源文件的结构差异,确定必须保留的字段与统一命名。

2

表头识别

自动探测真正的表头行,解决合并单元格、说明行和多级标题导致的读取问题。

3

匹配整合

以证券代码和年份为主键连接研发与专利数据,输出公司—年度分析表。

4

质量验证

检查重复键、缺失值、匹配率和异常年份,避免“合并成功”掩盖错配。

AI怎样参与这个项目

工具名称只能说明使用过什么。下面记录需求怎样形成、AI承担了哪些工作、我检查了什么,以及项目为什么在当前版本停止。

任务怎样被拆开

我把课程要求、各批Excel文件和希望得到的公司—年度面板交给Trae,先讨论哪些字段必须统一、哪些键适合连接,以及需要怎样记录匹配失败。

Trae负责哪些工作

Trae生成文件扫描、表头探测、字段别名、批量读取、双键匹配和质量报告代码。我负责决定证券代码与年份作为主要匹配键,并检查自动识别是否误读说明行、合并单元格和多级表头。

我怎样确认批量结果可以继续分析

我检查重复键、缺失值、匹配率、异常年份和未匹配清单。程序能够输出合并表只代表代码完成运行;只有数据损失能够被定位,结果才适合进入后续分析。

公开版本怎样保护原始资料

真实课程数据受到授权限制,公开仓库使用结构一致的合成样例。代码、字段规则和测试可以公开,真实公司数据不随仓库发布。

当前材料能够支持哪些结论

  • 将零散文件整理为可复用的批处理流程,减少逐年手工调整表头的工作。
  • 双键匹配比仅按公司名称更稳定,能避开简称变化与同名风险。
  • 把匹配率和未匹配清单作为产物保留,让后续分析知道数据损失发生在哪里。

哪些问题仍然需要更多数据

  • 真实原始数据受授权限制不公开,仓库只提供结构一致的合成样例。
  • 专利数量不直接等于创新质量,后续研究仍需加入专利类型、引用与行业背景。
  • 数据整合建立的是相关分析基础,不自动证明研发投入带来专利增长。

项目使用了哪些工具

  • Python
  • Pandas
  • Excel
  • 数据匹配
  • 质量检查
  • Trae

可以继续查看哪些材料

项目证据大图