选模型,从你要做的事开始我
输入材料
数据文件或只读查询结果、字段字典、业务问题和时间范围。
目标交付
清洗脚本、质量报告、探索图表、发现与分析限制。
怎样一步步完成
把工作拆成可检查的环节,再选择模型和配套工具。
- 01
理解粒度与口径
确认每行代表什么、主键是什么、时间和金额如何定义。
- 02
检查数据质量
运行代码统计缺失、重复、异常、类型和跨表关联问题。
- 03
探索分布与关系
用统计工具计算分布和分组差异,生成图表并记录筛选条件。
- 04
交付可复查结果
保留原始数据、脚本与处理日志,将结论链接到实际计算结果。
需要哪些模型能力
按实际环节组合使用,下面的目录会展示匹配其中一种或多种能力的候选。
查看匹配的模型配套工具
Python / R / SQL 执行环境表格和图表工具
选型与交付检查
- 代码生成模型需要配合真实执行环境,不能只输出一段分析话术。
- 缺失值处理与异常剔除应说明对结果的影响。
- 相关关系不能直接解释成因果关系。
可以这样描述需求
使用 Python 清洗 CSV 数据,检查缺失与重复,实际计算分组指标并生成图表,最后总结发现和局限。带着这个需求继续选型
