Data Science for Beginners 云端实战:基于 Azure ML Studio 的低代码/无代码机器学习全流程指南

发布时间:2026/9/11 18:27:57
Data Science for Beginners 云端实战:基于 Azure ML Studio 的低代码/无代码机器学习全流程指南
Data Science for Beginners 云端实战基于 Azure ML Studio 的低代码/无代码机器学习全流程指南【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners本篇技术指南来自 Data-Science-For-Beginners 课程的 18-Low-Code 章节原始课程文档系统讲解如何在不编写任何代码的前提下借助 Azure Machine Learning Studio 完成「数据准备 → AutoML 自动训练 → 模型部署 → REST 端点消费」的完整数据科学项目闭环。文章以心力衰竭风险预测项目为主线读者学完后将掌握 Azure ML 工作区与计算集群的创建方法、AutoML 无代码训练的配置技巧以及通过 REST API 与 Python 脚本消费已部署模型的实际能力并与后续的 Azure ML SDK 课程形成「无代码与有代码」两条路线对照。1. 引言为什么需要低代码/无代码的云上数据科学数据科学家在模型研发中会消耗大量时间用于数据探索、预处理以及反复试验不同的训练算法。这些任务耗时费力还常常造成昂贵计算资源的低效使用。微软 Azure 云平台提供了超过 200 种产品与云服务其中Azure Machine LearningAzure ML正是一套专为构建和运营机器学习解决方案而设计的云端平台它帮助数据科学家准备数据、训练模型、发布预测服务并监控其使用情况同时通过自动化许多耗时任务来提升效率更重要的是它支持按需弹性伸缩的云端计算资源只在真正使用时才产生费用。Azure ML 为开发者与数据科学家提供了覆盖完整机器学习工作流的工具矩阵Azure Machine Learning StudioAzure ML 的 Web 门户提供低代码/无代码的模型训练、部署、自动化、追踪与资产管理能力并与 Azure ML SDK 无缝集成Jupyter Notebooks快速原型化与测试 ML 模型Azure Machine Learning Designer通过拖拽模块构建实验并以低代码方式部署管道自动机器学习AutoML自动化模型开发中的迭代任务在保证模型质量的同时以高规模、高效率构建 ML 模型数据标注Data Labelling辅助 ML 的自动数据标注工具机器学习 Visual Studio Code 扩展完整的 ML 项目开发环境机器学习 CLI从命令行管理 Azure ML 资源开源框架集成支持 PyTorch、TensorFlow、Scikit-learn 等覆盖训练、部署与端到端流程管理MLflow开源实验生命周期管理库其中的MLFlow Tracking可记录并追踪训练运行指标与模型工件与实验环境无关。1.1 项目设定心力衰竭预测的两种实现路线本课程围绕同一目标探讨两条实现路径在 Azure ML Studio 中构建心力衰竭预测数据科学项目。如下图所示两种路径共享数据集与 AutoML 训练阶段区别在于操作方式——低代码/无代码走图形界面GUISDK 路线则以 Python 代码编程实现两种方式各有利弊。低代码/无代码方式上手门槛极低——只需与 GUI 交互、无需任何编码知识适合快速验证项目可行性、产出概念验证POC但当项目规模扩张、需要进入生产环境时通过 GUI 创建资源便不再现实此时需要以编程方式自动化「资源创建到模型部署」的全部环节这正是 Azure ML SDK 的用武之地。二者对比如下维度低代码/无代码Azure ML SDK编码知识不需要需要开发时间快速且简单取决于编码水平生产就绪否是1.2 心力衰竭数据集Heart Failure Dataset心血管疾病CVD是全球第一大死亡原因占全球死亡总数的 31%。吸烟、不健康饮食与肥胖、缺乏运动、酗酒等环境与行为风险因素可作为评估模型的输入特征若能评估个体罹患 CVD 的概率对高危人群的预防意义重大。课程采用 Kaggle 公开的 Heart Failure 临床数据集这是一个表格式数据集共 13 列12 个特征 1 个目标变量、299 行字段说明如下序号变量名类型描述示例值1age数值患者年龄252anaemia布尔是否红细胞或血红蛋白减少贫血0 或 13creatinine_phosphokinase数值血液中 CPK 酶水平5424diabetes布尔患者是否患有糖尿病0 或 15ejection_fraction数值每次收缩时离开心脏的血液百分比456high_blood_pressure布尔患者是否患有高血压0 或 17platelets数值血液中的血小板数量1490008serum_creatinine数值血液中血清肌酐水平0.59serum_sodium数值血液中血清钠水平jun10sex布尔女性或男性0 或 111smoking布尔患者是否吸烟0 或 112time数值随访期天421DEATH_EVENT目标变量布尔随访期内患者是否死亡0 或 1拿到数据集后即可在 Azure 中启动项目。2. 在 Azure ML Studio 中进行低代码/无代码模型训练2.1 创建 Azure ML 工作区Workspace工作区是 Azure Machine Learning 的顶级资源提供集中管理所有工件artifacts的场所。它会保留全部训练运行的历史记录包括日志、指标、输出以及脚本快照供你判断哪一次训练运行产出了最佳模型。浏览器方面建议使用与操作系统兼容的最新版本官方支持新版 Microsoft Edge最新版非 legacy 版、Safari最新版仅 Mac、Chrome最新版、Firefox最新版。注意只要 Azure ML 工作区存在于订阅中订阅就会被收取少量数据存储费用因此不再使用时请及时删除工作区。创建工作区步骤使用与 Azure 订阅关联的 Microsoft 凭据登录 Azure 门户选择创建资源Create a resource搜索 Machine Learning 并选择对应磁贴点击创建按钮按下述配置填写订阅Subscription你的 Azure 订阅资源组Resource group创建或选择资源组工作区名称Workspace name输入唯一名称区域Region选择离你最近的地理区域存储账户Storage account注意将为工作区新建的默认存储账户Key vault注意将为工作区新建的默认密钥保管库Application insights注意将为工作区新建的默认资源容器注册表Container registry无首次向容器部署模型时将自动创建点击「创建 审阅Create review」再点击「创建Create」等待工作区创建完成可能需要几分钟随后在门户的 Machine Learning 服务中进入该工作区在工作区概览页启动 Azure Machine Learning Studio或直接在浏览器访问 https://ml.azure.com 并使用 Microsoft 账户登录如被提示则选择你的 Azure 目录、订阅及工作区在 Studio 中点击左上角 ☰ 图标即可展开各功能页面用于管理工作区中的各类资源工作区也可通过 Azure 门户管理但对数据科学家与 MLOps 工程师而言Studio 提供了更聚焦的资源管理界面。2.2 计算资源Compute Resources计算资源是承载模型训练与数据探索过程的云端资源共有四类计算实例Compute Instances数据科学家的开发工作站创建虚拟机VM并启动 Notebook 实例可再从 Notebook 中调用计算集群训练模型计算集群Compute Clusters按需处理实验代码的可伸缩 VM 集群训练模型时必需可使用专用 GPU 或 CPU 资源推理集群Inference Clusters使用已训练模型部署预测服务的部署目标挂接计算Attached Compute关联现有的 Azure 计算资源如虚拟机、Azure Databricks 集群。2.2.1 计算资源选型的关键决策CPU 还是 GPUCPU中央处理器是以较高时钟频率快速处理广泛任务的电子电路但并发任务数受限GPU图形处理器专为并行计算设计因此更擅长深度学习任务。二者取舍如下CPUGPU更便宜更昂贵并发度较低并发度较高训练深度学习模型较慢深度学习最优集群大小Cluster Size更大的集群更贵但响应更好。有时间但预算有限应从集群起步反之资金充裕、时间紧张则选择更大的集群。虚拟机大小VM Size根据时间与预算约束可调节 RAM、磁盘、核心数与时钟频率——提升所有参数都会增加成本但带来更好的性能。专用还是低优先级实例Dedicated or Low-Priority低优先级实例是可被抢占的——Azure 可能将这些资源调配给其他任务从而中断当前作业专用不可抢占实例则不会未经许可被终止。这是又一层「时间 vs 金钱」的权衡可抢占实例更便宜。2.2.2 创建计算集群在之前创建的 Azure ML 工作区进入「Compute计算」菜单即可看到上述四类计算资源。本项目训练模型需要计算集群在 Studio 中点击「Compute」菜单 →「Compute cluster」标签 → 点击「 New」按钮选择选项专用 vs 低优先级、CPU 或 GPU、VM 大小与核心数本项目可保留默认设置点击「Next」为集群命名然后选择选项最小/最大节点数、缩容前的空闲时间、SSH 访问。注意最小节点数设为 0可在集群空闲时省钱最大节点数越大训练耗时越短官方推荐最大节点数为 3点击「Create」此步骤可能需要几分钟。完成集群创建后需要把数据加载进 Azure ML Studio。2.3 加载数据集在 Azure ML 工作区点击左侧菜单「Datasets数据集」点击「 Create dataset」按钮选择「From local files从本地文件」并选取此前下载的 Kaggle 数据集为数据集命名、选择类型、填写描述点击「Next」上传数据文件后再点「Next」在 Schema架构页面将以下特征的数据类型改为 Boolean布尔anaemia、diabetes、high blood pressure、sex、smoking、DEATH_EVENT。点击「Next」与「Create」。数据集就绪、计算集群创建完成后即可开始模型训练。这里将布尔特征显式声明为 Boolean 类型至关重要——它与原文档给出的数据字段类型表完全对应6 个布尔特征 6 个数值特征可避免 AutoML 将二值特征误判为数值回归问题。2.4 使用 AutoML 进行低代码/无代码训练传统 ML 模型开发资源密集、需要大量领域知识并且要花费时间生成和比较几十个模型。自动机器学习AutoML将模型开发中耗时、迭代的任务自动化让数据科学家、分析师与开发者以高可扩展性、高效率构建模型且不牺牲质量大幅缩短生产级模型的产出时间。操作流程在 Azure ML 工作区点击左侧菜单「Automated ML」选择刚上传的数据集点击「Next」输入新的实验名称Experiment name、目标列Target column选择DEATH_EVENT并选择之前创建的计算集群点击「Next」选择任务类型Classification分类点击「Finish」。此步骤根据计算集群大小约需30 分钟到 1 小时运行完成后点击「Automated ML」标签进入你的运行再点击「Best model summary最佳模型摘要」卡片中的算法即可查看 AutoML 生成的最佳模型详情在「Models」标签可浏览 AutoML 生成的其他候选模型也建议花几分钟探索「Explanations (preview)解释预览」功能查看模型可解释性分析。确定要使用的模型后本课程直接采用 AutoML 选出的最佳模型即可进入部署环节。3. 低代码/无代码模型部署与端点消费3.1 部署模型自动化机器学习界面允许你以几步操作将最佳模型部署为 Web 服务。部署Deployment即模型的集成落地使其能基于新数据做出预测。就本项目而言部署为 Web 服务意味着医疗应用可以实时调用模型预测患者发生心脏病的风险。在最佳模型描述页点击「Deploy」按钮为部署命名、填写描述计算类型选择Azure Container InstanceAzure 容器实例启用身份验证Enable authentication点击「Deploy」。此步骤约需20 分钟部署过程包括注册模型、生成资源并为其配置 Web 服务等多个环节可在「Deploy status」下查看状态消息定期点「Refresh」刷新当状态变为Healthy时即部署成功并运行中部署完成后点击「Endpoint端点」标签选中刚部署的端点即可查看该端点的全部细节3.2 消费端点Endpoint Consumption点击「Consume消费」标签可找到 REST 端点与一个 Python 消费脚本。该脚本可直接在本地机器上运行以消费你的端点重点看脚本中这两行代码url http://98e3715f-xxxx-xxxx-xxxx-9ec22d57b796.centralus.azurecontainer.io/score api_key # Replace this with the API key for the web serviceurl变量即「Consume」标签页中的 REST 端点地址api_key变量即「Consume」标签页中的主密钥Primary key仅当你启用了身份验证时才需要——这正是脚本消费端点的凭据机制。运行脚本应得到如下输出b{\\result\\: [true]}这表示对给定数据的心力衰竭预测结果为 true真。这符合预期脚本自动生成的示例数据默认全部为 0 和 false模型据此判为高风险。你可以将数据替换为下面的示例输入data { data: [ { age: 0, anaemia: false, creatinine_phosphokinase: 0, diabetes: false, ejection_fraction: 0, high_blood_pressure: false, platelets: 0, serum_creatinine: 0, serum_sodium: 0, sex: false, smoking: false, time: 0, }, { age: 60, anaemia: false, creatinine_phosphokinase: 500, diabetes: false, ejection_fraction: 38, high_blood_pressure: false, platelets: 260000, serum_creatinine: 1.40, serum_sodium: 137, sex: false, smoking: false, time: 130, }, ], }脚本将返回b{\\result\\: [true, false]}第一条记录全 0/全 false预测为true第二条真实临床样本60 岁、射血分数 38、随访 130 天等预测为false——至此你已在 Azure ML 上完成了模型的训练、部署与消费。注意请求体结构遵循{data: [ {特征字典}, ... ]}的约定字段名必须与数据集 Schema 中的 12 个特征完全一致。注意项目结束后记得删除所有资源以避免持续计费。4. 从低代码到 SDK两条路线的对照与进阶低代码/无代码体验到的每一步都能在 19-Azure 课程的 notebook.ipynb 中找到对应的 SDK 代码实现这恰好印证了 Studio 与 SDK 的无缝集成设计。对照要点如下工作区与实验Workspace.from_config()加载配置Experiment(ws, experiment_name)创建或获取实验实验名需为 3-36 个字符以字母或数字开头仅含字母、数字、下划线与连字符计算集群SDK 中AmlCompute.provisioning_configuration(vm_sizeStandard_D2_v2, min_nodes1, max_nodes3)与 GUI 中的节点配置一一对应见 notebook.ipynb 中的heart-f-cluster创建代码AutoML 配置GUI 选择的实验名、目标列、集群与任务类型对应 SDK 的AutoMLConfig参数——experiment_timeout_minutes20运行超时分钟数、max_concurrent_iterations3最大并发迭代数、primary_metricAUC_weighted主评估指标、taskclassification任务类型可选 classification/regression/forecasting、training_data、label_column_nameDEATH_EVENT、path、enable_early_stoppingTrue指标短期无提升时提前终止、featurizationauto自动特征化与debug_log调试日志文件部署与消费SDK 使用InferenceConfigAciWebservice.deploy_configuration(cpu_cores1, memory_gb1)在 Azure 容器实例上部署对应 GUI 的 Deploy 按钮并以aci_service.run(input_datatest_sample)消费端点。从源码结构看GUI 的每次点击背后都是这些 SDK 对象的等价操作这也解释了课程中「项目成长后必须转向 SDK 自动化」的判断依据。5. 课后挑战与延伸练习模型可解释性挑战仔细观察 AutoML 为顶级模型生成的 Explanations 与详情尝试理解为什么最佳模型优于其他模型——AutoML 比较了哪些算法它们之间有何差异为什么在此案例中该模型表现更好独立实战任务参考 课程作业 的要求——从 Kaggle 或 Azure Open Datasets 寻找新的数据集上传时按需调整特征类型并清理数据通过 AutoML 完成一次训练、检查模型解释、部署最佳模型并成功消费。作业评分标准Rubric依次为完成「类型调整 数据清洗 AutoML 训练 解释检查 部署消费」为优秀省略解释检查为合格仅完成「部署并消费 AutoML 最佳模型」为待改进。总结本课程完整走通了「创建工作区 → 创建计算集群 → 上传数据集 → AutoML 无代码训练 → 部署 Web 服务 → REST 端点消费」的低代码数据科学闭环并借由 19-Azure 的 SDK 对照实现 与 notebook.ipynb 展示了同一流程的编程化写法。低代码/无代码路线适合快速验证与 POCSDK 路线适合生产级自动化二者的结合正是云端数据科学的完整能力图谱。【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考