ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

数据科学入门:数据集分类实战——从结构、取值与来源三维度精准判定数据类型

数据科学入门:数据集分类实战——从结构、取值与来源三维度精准判定数据类型 数据科学入门数据集分类实战——从结构、取值与来源三维度精准判定数据类型【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners导读本文围绕 Microsoft 开源课程 Data-Science-For-Beginners 中《Defining Data定义数据》一课配套的 Classifying Datasets 分类练习 展开系统讲解如何从「结构类型Structured / Semi-Structured / Unstructured」「取值类型Qualitative / Quantitative」「来源类型Primary / Secondary」三个维度对现实数据集进行分类。读完本文你将掌握一套可直接套用的数据分类判定流程能够独立完成练习中的 5 道场景题并学会用仓库中的真实数据文件CSV、JSON、TSV 等举一反三地验证自己的判断。练习在课程中的位置与目标本练习隶属于课程第一部分「数据科学导论」的第 3 课对应主文档 1-Introduction/03-defining-data/README.md。该课的核心观点是数据Data是用于发现规律、支持决策的事实、信息、观测与测量。数据集Dataset由数据点Data Point构成不同数据集会因其来源与用途呈现出不同的格式和结构。课程明确指出数据科学家常常需要在同一份数据集里处理多种不同类型的数据因此识别并分类数据是数据工作者的基本功。本练习要求读者针对 5 个贴近真实工作的场景分别给出三组分类标签结构类型结构化Structured、半结构化Semi-Structured或无结构化Unstructured取值类型定性Qualitative或定量Quantitative来源类型一手Primary或二手Secondary下文先提炼课程主文档中的分类判据再逐题给出判定过程与依据最后提供自评标准与仓库内的延伸训练素材。三大分类维度判定速览1. 结构类型数据如何组织类型判定特征课程给出的典型例子结构化 Structured组织为行与列每一行拥有相同的列集合列代表特定类型的取值并常带规则约束如手机号不为空且只能含数字电子表格、关系型数据库、电话号码簿、银行对账单非结构化 Unstructured无法归入行或列没有固定格式或规则新增信息容易但分析耗时更长如传感器故障时记录e导致数据不完整文本文件、短信、视频文件半结构化 Semi-Structured通常不遵循行列格式但有一定组织方式或规则可包含标签tags、元素elements、实体entities、属性attributes等元数据HTML、CSV 文件、JSON从主文档的定义可以看出一个关键细节「电子表格」被归为结构化数据而「CSV 文件」被归为半结构化数据。原因在于带有强约束如必填、数据类型校验的电子表格具备严格的模式而裸 CSV 文件只有表头元信息、缺乏强制模式属于介于两者之间的形态。这是练习中最容易混淆的判定点值得特别注意。2. 取值类型数据表达什么定量数据Quantitative数据集中的数值型观测可以分析、测量并用于数学运算。课程示例国家人口、人的身高、公司季度盈利进一步分析可发现 AQI 季节趋势、估算通勤高峰概率。定性数据Qualitative也称类别数据Categorical Data无法像定量数据那样客观测量通常以多种形式承载主观信息刻画某个产品、过程或对象的质量。课程特别强调某些定性数据在形式上也是数字但不会用于数学运算——例如电话号码、时间戳。判定要点判断取值类型不能只看是不是数字而要看这个值是否承载可计算的量。电话号码虽然由数字组成但做加减乘除没有意义因此属于定性数据。3. 来源类型数据从哪来一手数据Primary由使用者/采集者直接生成的数据。课程示例科学家团队在雨林中亲自收集的观测记录。二手数据Secondary来自他人为通用目的收集好的数据。课程示例上述科学家把雨林观测分享给其他科学家对使用方而言即为二手数据。主文档还归纳了常见数据源数据库通过查询命令 Query 探索、文件音频、图像、视频、Excel 电子表格、互联网承载数据库与文件、API通过接口向外部用户共享数据、网页抓取Web Scraping。数据科学的工作流常把一手数据与二手数据混合使用后续课程 2-Working-With-Data 会深入讲解如何操作这些数据源。五道场景题的逐步判定下面按练习 assignment.md 的原始顺序逐题解析。每一题先还原场景再给出三个维度的分类标签与判定依据。场景 1母公司移交的客户电话号码表一家公司被收购其数据科学家从母公司收到一份客户电话号码电子表格。结构类型结构化Structured——场景明确说明数据是电子表格Spreadsheet按行与列组织且电话号码列天然具有约束规则不能为空、只能包含数字正是课程对结构化数据的描述。取值类型定性Qualitative——电话号码是课程中点名的典型定性数据虽然由数字构成却从不参与数学运算只用于标识与联系客户。来源类型二手Secondary——数据由母公司此前收集数据科学家是接收方而非采集方与课程雨林观测分享给其他科学家即为二手的例子同理。场景 2智能手表采集的 JSON 心率数据智能手表持续采集佩戴者的心率原始数据格式为 JSON。结构类型半结构化Semi-Structured——JSON 是课程明确列出的半结构化数据示例它不遵循行列格式但具有清晰的层级结构键值对、对象数组并携带标签/属性等元数据。仓库中的 PersonsData.jsonfirstname、age字段与 TwitterData.jsoncreated_at、id、text字段就是典型样例。取值类型定量Quantitative——心率是可直接测量、参与统计分析的数值型观测如求平均值、分析趋势符合课程对定量数据的定义。来源类型一手Primary——数据由佩戴者本人穿戴的设备直接生成属于使用者直接采集的数据。场景 3存于 CSV 的员工士气调研一份关于员工士气的职场调查问卷存储在 CSV 文件中。结构类型半结构化Semi-Structured——课程将 CSV 文件归为半结构化数据它有表头行作为元数据但不像严格数据库那样施加字段约束结构较为松散。仓库 data/emails.csv、data/mushrooms.csv、data/birds.csv 均为此类形态。取值类型定性Qualitative——士气是典型的主观质量刻画问卷答案满意度评分、文字反馈、选项类别无法客观测量属于定性数据即便部分题目用 1–5 分表示其本质仍是态度量表中的类别。来源类型一手Primary——调查数据由企业直接向员工收集员工本人是生成者属一手数据。场景 4太空探测器采集的星系数据库天体物理学家访问一个由太空探测器采集的星系数据库其中包含每个星系的类地行星数量。结构类型结构化Structured——数据库是课程列出的结构化数据代表数据按行每个星系一条记录与列星系名、行星数量等字段组织。取值类型定量Quantitative——行星数量是可计数、可比较、可做数学运算的数值观测。来源类型二手Secondary——数据由太空探测器而非使用它的天体物理学家采集科学家属于使用他人采集成果的一方因此是二手数据。注意区分如果天体物理学家亲手操作望远镜记录数据那才算一手。场景 5通过 API 聚合的财务交易流水个人理财应用通过 API 连接用户财务账户以计算净资产用户可见的交易数据呈行列格式形似电子表格。结构类型结构化Structured——场景明确描述行列格式、形似电子表格每笔交易共享相同的字段集合日期、金额、商户等符合结构化特征。取值类型定量Quantitative——交易金额与净资产计算是典型的数值运算场景当然交易描述、商户名称等字段本身是定性类别练习要求对整体给出一个标签核心用途算净值指向定量。来源类型二手Secondary——交易流水由银行等金融机构原始产生理财应用通过 API 获取后聚合展示对应用开发方而言并非自己采集的数据属于二手数据。参考答案速查表场景结构类型取值类型来源类型1. 母公司移交的客户电话表结构化定性数字但不参与运算二手2. 智能手表 JSON 心率数据半结构化定量一手3. CSV 员工士气调研半结构化CSV 属半结构化定性一手4. 探测器采集的星系数据库结构化定量二手5. API 聚合的财务交易流水结构化定量以交易金额计二手易错点复盘① 电话号码是数字形态的定性数据② 电子表格≠CSV 文件前者结构化、后者半结构化③ 一手/二手取决于使用方是否自己生成数据而不是数据的新旧。评分标准与自评方式练习末尾附带了评分量表Rubric用于客观评估掌握程度Exemplary优秀Adequate合格Needs Improvement待改进全部 5 个场景的结构、取值、来源分类全部正确正确识别 3 个场景的结构、取值、来源分类正确识别 2 个或更少的场景建议自评时不要只对答案而是对每道题复述一遍为什么结构看组织方式、取值看是否可计算、来源看生成者与使用者的关系。只有能把三个维度的判据讲清楚才真正达到Exemplary水准。延伸训练用仓库真实数据验证你的分类能力课程主文档的 Challenge 环节建议从公开数据集平台寻找 3–5 个数据集并按相同标准分类。本仓库 data 目录恰好提供了多种真实数据文件可当作零成本练习素材CSV 类data/birds.csv鸟类体征长度、体重、翼展为定量列科/目/保护状态为定性列、data/mushrooms.csv菌类外观属性几乎全为定性类别、data/taxi.csv出租车行程费用、里程、乘客数定量支付方式定性、data/emails.csv垃圾邮件关键词频次、data/honey.csv蜂蜜产量与价格、data/COVID/time_series_covid19_confirmed_global.csv每日累计确诊时间序列TSV 类data/SOCR_MLB.tsv棒球球员身高体重、data/diabetes.tsv糖尿病生理指标——以制表符分隔与 CSV 同属半结构化文件JSON 类2-Working-With-Data/06-non-relational/PersonsData.json、TwitterData.json——半结构化数据的标准样例例如对 data/birds.csv结构类型为半结构化CSV、取值类型为混合长度/体重/翼展列是定量科/属/保护状态列是定性、来源类型为二手由鸟类观测项目汇总发布。动手实践时可借助仓库 examples/02_loading_data.py 中的 pandas 加载流程pd.read_csv(../data/birds.csv)、data.info()、data.describe()先观察每一列的实际取值再结合数据含义给出分类——这正是课程「从特征与来源识别数据」理念的可操作化落地。你甚至可以依次把 examples 中的示例跑一遍熟悉从加载、探索到可视化的完整链路为后续 2-Working-With-Data 各课的学习打下基础。小结本练习表面上只是 5 道分类题实际上训练的是数据科学家的第一直觉拿到任何数据集先回答三个问题——它如何组织结构、它表达什么取值、它来自哪里来源。掌握这套三维判定框架后无论是处理 CSV、JSON 还是数据库导出文件你都能快速定位数据的性质为后续的数据准备、可视化与建模选择合适的处理策略。【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进