Data Science for Beginners 课程使用指南:从课程结构到 Jupyter、Quiz 与离线部署的完整实战手册
Data Science for Beginners 课程使用指南从课程结构到 Jupyter、Quiz 与离线部署的完整实战手册【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners本指南以 Data Science for Beginners 课程的 USAGE.md本仓库根目录为核心骨架系统讲解这套10 周、20 课数据科学课程的实际使用方法。你将掌握课程的标准化学习流程、Jupyter Notebook 的启动与运行技巧、内置 Quiz 测验应用的本地启动与题目编号规则、四条典型学习路径自学者路径、专题路径、项目制路径、云上路径以及面向教师的教学计划安排与离线环境部署方案。课程概况与本指南的定位Data Science for Beginners 是一个面向零基础学习者的数据科学课程仓库共包含20 节课、40 个测验、20 个作业课程按主题划分为 6 大部分每部分对应仓库中的独立目录可从 docs/_sidebar.md 的侧边栏结构确认1-Introduction定义数据科学01、数据伦理02、定义数据03、概率与统计042-Working-With-Data关系型数据库05、非关系型数据库06、Python07、数据准备083-Data-Visualization数量可视化09、分布可视化10、占比可视化11、关系可视化12、有意义的信息图134-Data-Science-Lifecycle生命周期导论14、分析15、沟通165-Data-Science-In-Cloud云端数据科学导论17、低代码 ML 工具18、Azure 机器学习工作室196-Data-Science-In-Wild真实世界案例20。本指南面向的是如何使用这套课程而不是如何安装——环境搭建细节请参阅 INSTALLATION.md包含 Git、Python、Jupyter、Node.js、Docsify 的逐步安装流程。如果学习中遇到环境问题可查阅 TROUBLESHOOTING.md 或 CONTRIBUTING.md。如何使用这套课程课程设计为高度灵活的形态官方建议四种使用方式可单独使用也可组合自学Self-paced learning按自己的节奏独立完成每一课课堂教学Classroom instruction作为结构化课程由教师引导授课学习小组Study groups与同伴协作学习、互相讨论工作坊Workshop format以短期密集型学习班的形式集中推进。无论采用哪种方式每一课都遵循一套统一的标准化课程结构这是整套课程可复用的关键设计。课程的标准结构与单课学习流程每课固定的七步结构每节课都按以下顺序组织内容以保证学习体验的一致性课前测验Pre-lesson Quiz先测试既有知识带着问题进入学习涂鸦笔记 Sketchnote可选对关键概念的视觉化总结全部速记图集中在 sketchnotes 目录视频可选补充性的视频教学内容书面课程Written Lesson核心概念讲解即各课目录下的README.mdJupyter Notebook动手编程练习作业Assignment练习并巩固所学课后测验Post-lesson Quiz强化理解。以第一课为例1-Introduction/01-defining-data-science 目录下同时包含README.md书面课程、notebook.ipynb编程练习、assignment.md作业与solution/参考答案完整体现了这一结构。单课标准操作流程官方给出的单课学习命令流程如下命令中的注释即操作说明# 1. 进入课程目录 cd 1-Introduction/01-defining-data-science # 2. 阅读 README.md # 在浏览器或编辑器中打开 README.md # 3. 完成课前测验 # 点击 README 中的测验链接 # 4. 打开 Jupyter notebook如该课提供 jupyter notebook # 5. 完成 notebook 中的练习 # 6. 完成作业 # 7. 完成课后测验在 Jupyter Notebook 中动手实践启动 Jupyter进入任一课程目录后先激活虚拟环境再启动 Jupyter# 激活虚拟环境macOS/Linux source venv/bin/activate # Windows 使用 venv\Scripts\activate # 在仓库根目录启动 Jupyter jupyter notebook浏览器将自动打开 Jupyter 界面随后即可导航到任意课程的.ipynb文件。仓库中大量课程都预置了 notebook例如 1-Introduction/04-stats-and-probability/notebook.ipynb、2-Working-With-Data/08-data-preparation/notebook.ipynb、3-Data-Visualization/09-visualization-quantities/notebook.ipynb 等。Notebook 单元格的三种核心操作执行单个单元格按Shift Enter或点击工具栏 Run 按钮执行全部单元格菜单 Cell → Run All重启内核若遇到状态异常或变量污染选择 Kernel → Restart 重新初始化。在 Notebook 中处理数据的标准范式课程 notebook 统一使用 pandas numpy matplotlib 的加载—探索—可视化三段式写法这段代码也是本仓库各课程 notebook 的共同模式例如 08-data-preparation 的作业 notebook 即按此范式组织# 导入必需库 import pandas as pd import numpy as np import matplotlib.pyplot as plt # 加载数据集 df pd.read_csv(data/sample.csv) # 探索数据 df.head() df.info() df.describe() # 创建可视化 plt.figure(figsize(10, 6)) plt.plot(df[column_name]) plt.title(Sample Visualization) plt.xlabel(X-axis Label) plt.ylabel(Y-axis Label) plt.show()实际练习时可将data/sample.csv替换为仓库 data 目录中真实存在的数据集例如birds.csv鸟类体征数据用于可视化课程、honey.csv美国蜂蜜产量数据、diabetes.tsv糖尿病指标数据注意是制表符分隔需pd.read_csv(data/diabetes.tsv, sep\t)、mushrooms.csv、taxi.csv等COVID 时序数据位于 data/COVID。保存你的工作Jupyter 会周期性自动保存手动保存按Ctrl SmacOS 为Cmd S所有进度保存在.ipynb文件中该文件为 JSON 格式可直接纳入版本管理。使用 Quiz 测验应用本地启动 Quiz 应用Quiz 应用是一个基于 Vue 2 的前端工程位于 quiz-app 目录其package.json定义的启动脚本为vue-cli-service serve# 进入 quiz 应用目录 cd quiz-app # 启动开发服务器 npm run serve # 浏览器访问 http://localhost:8080从 quiz-app/src/main.js 可以看到应用使用 vue-routermode: history与 vue-i18n默认语言en回退语言en构建路由配置位于 quiz-app/src/router/index.js核心路由为/quiz/:id因此测验 URL 形如/quiz/0。生产构建使用npm run build代码检查使用npm run lint。测验规则与编号体系每课两个测验课前测验链接在每课 README 顶部课后测验链接在 README 底部每场测验 3 道题这并非约定而是源码强制逻辑——quiz-app/src/components/Quiz.vue 的handleAnswerClick方法中写死nextQuestion 3才继续出下一题答满 3 题后进入完成状态测验定位为强化学习而非应试评估答错会提示错误并要求重试对应源码中的error状态编号 0-39 共 40 个与20 课 × 每课前后各 1 个一一对应测验 URL 中包含编号例如官方示例https://ff-quizzes.netlify.app/en/ds/quiz/0第 1 课课前测验多语言支持测验题库按语言分组存放于 quiz-app/src/assets/translations目前包含en、es、fr三套可通过 URL 查询参数?locfr切换语言。四条常见学习路径Common Workflows路径 1零基础完整路线适合没有任何数据科学背景的初学者按顺序学完 20 课# 1. 配置环境参见 INSTALLATION.md # 2. 从第 1 课开始 cd 1-Introduction/01-defining-data-science # 3. 对每一课 # - 完成课前测验 # - 阅读课程内容 # - 完成 notebook 练习 # - 完成作业 # - 完成课后测验 # 4. 依次学完全部 20 课路径 2专题定向学习对某个主题感兴趣时可跳过其他部分直达目标专题。例如聚焦数据可视化第 9-13 课cd 3-Data-Visualization # 依次探索 # - 第 9 课数量可视化 # - 第 10 课分布可视化 # - 第 11 课占比可视化 # - 第 12 课关系可视化 # - 第 13 课有意义的信息图该目录下除各课 README 外还提供 R 语言版本的可视化实现见 3-Data-Visualization/R适合偏好 R 的学习者对照学习。路径 3项目制学习先建立数据科学生命周期的整体框架再通过真实案例把知识串起来# 1. 先学习数据科学生命周期课程第 14-16 课 cd 4-Data-Science-Lifecycle # 2. 完成第 20 课的真实世界案例 cd ../6-Data-Science-In-Wild/20-Real-World-Examples # 3. 将所学概念应用到自己的项目中路径 4云端数据科学聚焦云端工作流第 17-19 课对应仓库 5-Data-Science-In-Cloud 目录# 学习云端数据科学第 17-19 课 cd 5-Data-Science-In-Cloud # 第 17 课云端数据科学导论 # 第 18 课低代码 ML 工具 # 第 19 课Azure 机器学习工作室自学者建议保持组织性建立学习日志为每课创建笔记文件mkdir my-learning-journal echo # Lesson 1 Notes my-learning-journal/lesson-01-notes.md规律练习每天或每周固定投入时间建议每周至少完成一课并周期性回顾已学内容学以致用学完课程后将技术迁移到自己的项目官方给出的自查清单覆盖了课程核心技能# 示例分析自己的数据集 import pandas as pd # 加载自己的数据 my_data pd.read_csv(my-project/data.csv) # 应用学到的技术 # - 数据清洗第 8 课 # - 探索性数据分析第 7 课 # - 数据可视化第 9-13 课 # - 数据分析第 15 课教师使用指南课堂环境搭建详细指引参见 for-teachers.md其中说明了如何 fork 本仓库并使用 GitHub Classroom 按课拆分仓库、以私有仓库让学生提交作业等操作搭建共享环境GitHub Classroom 或 Codespaces建立沟通渠道Discord、Slack 或 Teams。推荐的 10 周教学计划官方按6 大部分、20 课给出了可直接照搬的教学排期第 1-2 周导论第 1-4 课第 3-4 周处理数据第 5-8 课第 5-6 周数据可视化第 9-13 课第 7-8 周数据科学生命周期第 14-16 课第 9 周云端数据科学第 17-19 课第 10 周真实世界应用与期末项目第 20 课。用 Docsify 实现离线课堂访问本仓库以 Docsify 组织文档侧边栏结构见 docs/_sidebar.md教师可用 Docsify 在本地起一个纯静态文档站学生连接同一局域网即可访问首次初始化后无需联网# 在仓库根目录本地托管文档 docsify serve # 学生访问 localhost:3000 # 初始配置完成后无需联网作业批改与自定义作业模板批改要点检查学生 notebook 是否完成全部练习、通过测验得分判断理解程度、用数据科学生命周期原则评估期末项目自定义作业模板官方给出的标准模板要求作业覆盖加载探索 → 清洗准备 → 至少 3 张可视化 → 分析 → 沟通结论完整链路产出物为带代码与解释的 Jupyter notebook 加书面结论总结。完全离线使用预下载资源# 克隆整个仓库 git clone https://github.com/microsoft/Data-Science-For-Beginners.git # 数据集已提前内置 # 大多数数据集已包含在仓库的 data/ 目录中克隆后即可在无网环境中使用全部课程文档、数据集与 notebook。本地运行文档与 Quiz# 1. 用 Docsify 本地托管文档 docsify serve # 访问 localhost:3000 # 2. 本地启动 Quiz 应用 cd quiz-app npm run serve # 访问 localhost:8080需要说明的是Quiz 应用与 Docsify 文档站依赖 npm 依赖包预装完成因此建议在联网环境下先完成 INSTALLATION.md 中的环境准备步骤。访问多语言翻译内容仓库在 translations 目录下提供40 语言的完整翻译每套翻译与英文原版保持完全一致的目录结构各语言均包含 70 个 md 文档与 25 个 ipynb notebook# 访问翻译版课程 cd translations/fr # 法语 cd translations/es # 西班牙语 cd translations/de # 德语 # ... 以及更多语言本文档对应的希腊语版本即位于 translations/el/USAGE.md可对照阅读。此外 translated_images 目录为各语言提供翻译后的课程配图。常见问题排查与进一步学习遇到问题时按以下顺序排查查看 TROUBLESHOOTING.md 中记录的常见问题如端口被占用、notebook 内核异常等在仓库 Issues 中搜索是否已有相同问题如需报告问题或参与贡献遵循 CONTRIBUTING.md 的流程。本课程是微软for Beginners系列课程之一同系列还包括 AI、ML、Web Dev 与 Generative AI 等主题课程学完本课程后可沿同类路径继续进阶。所有课程资源含数据集、notebook、涂鸦笔记均已包含在本仓库中无需额外获取外部资料即可完整走完 10 周的学习旅程。【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考