问题最初是怎样展开的
项目从2026年1—5月约1,453万条骑行记录开始。我先把单次骑行整理成站点—小时供需数据,再加入时间、天气、站点容量和历史行为特征,分别预测借车量与还车量。预测结果随后进入动态定价策略、FastAPI接口和可视化看板,形成了从数据到产品演示的完整过程。工作台复核时,我重新检查了模型在预测时刻究竟能够知道哪些信息。三个比例字段使用了当前小时已经发生的借还车结果,随机切分又把不同日期和季节的记录混合分配到训练集与测试集,因此旧版R²需要结合实验设计重新解释。
哪些发现改变了原来的方案
我保留了原课程版,因为原课程版记录了数据获取、建模、策略、API和看板怎样连接起来。随后增加修复分支:移除三个在预测开始时无法获得的字段,按时间先后划分训练、验证和测试数据,并在2.4万行样本上完成三组最小验证。修复分支的指标低于旧版,当前结果用于确认新流程可以运行,以及旧版高分确实受到特征和切分方式影响。千万级数据的完整重训、旧API和旧看板的同步更新没有继续执行,因为当前目标已经收缩为证明工作台能够帮助发现问题并推动一次可验证的修改。
这个项目处理了哪些具体工作
项目完整经历了官方数据整理、分层存储、站点—小时聚合、特征工程、借还车需求预测、动态定价策略、FastAPI接口和可视化展示。后续复核增加了时间切分与安全特征版本,并保留旧版与修复版的用途差异。
我在项目中负责哪些判断
项目由本人独立完成。我负责确定业务问题、判断数据粒度、选择技术路线、拆分阶段、检查模型指标、解释工作台疑点、决定修复范围,并确认哪些结果能够公开。AI负责调研参考项目、展开代码实现、生成测试与文档初稿;最终的指标解释、错误修正和停止条件由本人确认。
项目经历了哪些阶段
采集与存储
整理2026年1—5月16个CSV文件,使用Parquet分层保存,避免每次从头读取约2.7GB原始数据。
清洗与聚合
统一字段、处理异常记录,再把单次骑行聚合到“站点—小时”,形成可建模的供需表。
特征与建模
组合时间、天气、容量和历史行为特征,训练借车量与还车量模型,并通过FastAPI提供策略演示。
可信复核
工作台发现3个同小时结果字段和随机切分风险;移除风险字段并改用时间切分,完成2.4万行三组对照验证。
记录修正范围
将旧R² 0.644标记为课程版结果,并把2.4万行的新结果说明为最小运行验证,避免读者把它理解成千万级完整重训成绩。
AI怎样参与这个项目
工具名称只能说明使用过什么。下面记录需求怎样形成、AI承担了哪些工作、我检查了什么,以及项目为什么在当前版本停止。
首版方案怎样形成
我先把课程要求和动态定价想法交给Claude Code与DeepSeek Pro,再让AI查找需求预测、站点供需和价格激励的已有项目。方案经过讨论后被拆成数据整理、特征工程、模型训练、策略计算、API和展示页面。
AI在实施阶段负责什么
Claude Code主要生成PySpark、Pandas、scikit-learn、FastAPI和可视化代码,DeepSeek Pro参与方案讨论与解释。我逐阶段阅读输出、运行程序、检查文件和指标,并决定是否进入下一阶段。
复核为什么更换了工具
项目完成后,我把旧版数据和报告交给可信分析工作台,并使用Codex与ChatGPT-sol重新检查预测时点、字段来源和切分方式。不同工具给出的判断没有直接作为结论,我继续回到数据定义、代码和报告中核对。
我怎样决定停止位置
修复版完成了安全字段、时间切分和最小验证以后,我没有继续重做全部API与看板。当前求职展示需要证明原项目能够被复核和修改,继续重建所有旧产物不会改变这个结论,因此被列为后续工作。
项目参考了哪些现有资料
我会先查找能够满足相似需求的项目,再判断哪些方法可以复用、哪些部分需要重新设计。这里只记录已经能够确认来源和实际关系的资料。
Shakleen / CitiBike-Demand-Prediction ↗
参考了大规模CitiBike数据处理、需求预测和Web接口的整体技术路线;本项目重新选择了数据时间范围、聚合口径、特征和模型。
Bikenomics — NYC Citibike Optimization
本地保留了该项目的README快照,参考了站点供需、价格激励和用户引导的产品思路。原仓库地址没有保留,因此网站暂不提供外部链接。
这些页面分别证明什么
下面保留项目实际页面和产物。图片可以放大,说明文字标明每张页面在项目中承担的作用。
当前材料能够支持哪些结论
- 旧版高分同时受到模型、字段来源和数据切分方式影响,不能只根据一个R²判断未来预测能力。
- 工作台把112条重复拒绝合并成总览,最终定位为少数共性问题,减少了审查噪声。
- 修复版移除了预测时点无法获得的字段,并使用时间切分;指标下降记录了评估条件变化带来的影响。
哪些问题仍然需要更多数据
- 2.4万行结果用于验证修复后的代码、数据切分和指标计算能够完整运行,不能代表千万级数据完整重训后的最终精度。
- 当前FastAPI和旧可视化仍用于展示课程版产品链路,页面中会明确标注Legacy边界。
- 动态定价属于策略模拟,不代表真实商业环境中的因果收益。