微软的云收入在 2024 财年连续多个季度超出市场预期,AI 并没有停留在概念验证阶段,而是实实在在地拉动了基础设施投资。这种增长背后,本质上是一次从通用算力向 AI 专用算力的大规模切换,也是理解 Azure AI 数据中心建设趋势分析的关键起点——只有当 AI 需求成为财报中无法忽视的增量,围绕高性能算力的基建扩张才有逻辑支点。
一、微软Azure云业务为什么持续增长?
1. 核心驱动力是什么
Azure 增长的直接推手已从传统 IaaS 迁移转向 AI 工作负载。管理层在财报电话会上多次提到,AI 服务的贡献占比逐季提升,且需求持续超过供给能力。这种供不应求的状态并非短期扰动,而是 GPT-4 级别模型训练常态化后的结构性变化——单次训练就需要数万张 GPU 互联,租用规模远超普通云消耗。企业客户从“试探性调用 API”进入“将 AI 嵌入核心业务”的阶段,催生了持续的高性能算力需求。
2. 财报数据解读
从公开数据看,微软智能云板块的增速在 AI 加持下重新加速,Azure 营收增长中 AI 贡献的百分点从 1 个点扩大到多个点仅用了三个季度。这组数据的意义在于:它证实了 GPU 实例不是边缘产品,而是正在成为 Azure 增量的核心支柱。当一个季度内 AI 相关收入可以带动整体增速 3-4 个百分点时,后续数据中心建设的方向几乎没有悬念——优先保障 AI 算力供给。
3. AI需求的影响
AI 需求正在改写云服务的供应链逻辑。微软为 OpenAI 和 Copilot 构建的超级计算机已互联数万张 GPU,并公开表示正在规划下一代更大规模集群。这种量级的变化迫使数据中心彻底重构:供电从传统的每机柜 5-10kW 跳到 30kW 以上,液冷方案从可选项变成必选项,网络架构也必须从通用拓扑转向 InfiniBand 与超以太网混合部署。AI 不再只是云服务上的一个功能,它已经成为数据中心设计的原点。
二、什么是AI数据中心与高性能算力集群?
如果把传统数据中心比作一个存放服务器和数据的“仓库”,那AI数据中心更像一个为了跑通千亿参数模型而设计的“超级大脑”——它对算力密度、网络互联和散热方式的要求,与通用型数据中心根本不在一个量级。这套基础设施的形态在过去两年里发生了急剧变化,但行业对它的理解仍然充满认知错位。
1. AI数据中心:不止是堆GPU,而是一次架构重构
AI数据中心并不是在普通数据中心里塞进几台GPU服务器就大功告成,它需要整套供电、散热、网络与存储体系的重新设计。以Azure为OpenAI构建的超级计算机为例,其单集群互联了数万张加速卡,单机柜功率密度可达数十千瓦,传统的风冷方案已无法支撑,必须引入液体冷却和全新的供电架构。这是物理层的硬约束:当单台GPU服务器功耗超过10kW,继续用“电+空调”模式只会让PUE失控。
需求侧的紧迫感比想象中更强烈。微软2024财年多个季度电话会中都释放了同一个信号:AI服务的营收贡献在Azure中持续跃升,但算力供给仍然跟不上客户需求,扩容基础设施被管理层列为第一优先级。反映到企业端,最直接的体感就是GPU实例的等待时间——在GPT-4级别的大模型训练高峰期,公有云特定区域的A100/H100实例经常显示“无资源可用”,导致实验排期延后数周。这不是简单的缺货,而是整个行业在AI训练规模爆发时面临的共性瓶颈。
2. 高性能算力集群:三要素决定训练效率,而非GPU数量
很多人误以为砸钱买更多GPU就能线性提升训练性能,但实际情况是,当分布式训练节点超过一定规模,通信开销会成为致命短板。高性能算力集群的核心竞争力由三个要素共同决定:异构算力、高速互联和并行存储。用行业常说的话,就是“算力决定上限,网络决定下限”。
网络互联这一层尤其容易被低估。微软为AI工作负载设计的定制化网络拓扑,在InfiniBand与超以太网方向上都有深度布局——因为这直接关系到万卡集群的线性扩展能力。一个真实的对比是:在没有优化通信的情况下,1024张GPU的集群可能实际有效算力只相当于512张,多出来的卡都在等梯度同步。这也是为什么Azure的NDv5或ND H100 v5实例序列会特别标注InfiniBand互联区域,企业如果把训练任务部署到不支持低延迟互联的可用区,花同样的钱可能只拿到一半的效率。
存储架构的改造同样被疏忽。传统SAN或NAS存储面对大模型训练中成百上千个节点同时读取TB级训练数据的需求时,I/O路径上的瓶颈会拖慢整个训练流水线。因此,AI数据中心会采用并行文件系统和近存储计算的设计,让数据尽可能靠近算力节点,减少数据搬运开销。再加上微软自研的Azure Maia 100 AI加速器这类定制芯片开始登场,整个集群从通用型计算向异构加速的转变已成定局——这不再是某个厂商的路径选择,而是规模化AI训练必然要走的路线。
三、微软如何布局AI数据中心?
AI数据中心早已不是传统机房加装GPU扩展柜的逻辑。当单集群规模动辄上万张加速卡,供电、散热、互联每个环节都在逼近物理极限,谁先完成基础设施代际重构,谁就掌握了模型训练窗口期的算力话语权。微软这轮布局,本质上是在用超大规模工程投资,把AI算力从紧缺资源变成可规模化交付的水电。
1. 全球建设规划:从“缺卡”焦虑到区域弹性供给
微软2024财年多个季度财报电话会中,管理层反复传递一个信号——AI需求持续超出供给能力,基础设施投入的优先级被提到最高。一个可量化的事实是,Azure营收增速中AI服务的贡献占比逐季走高,而这背后全靠不断扩张的数据中心底座在承接。
单纯的“量大”已经不够,区域选择变得同样关键。根据公开可追踪的扩容动态,Azure的GPU实例在美东2、瑞典中、英国南等区域投放密度更高,部分用户会在主区域资源告急时,主动将训练作业拆分迁移至这些新扩容节点,以缩短排队等待时间。这种“算力流动性”不是偶然,而是微软在建设阶段就预埋的弹性策略:核心训练集群优先部署于电价可控、绿电覆盖率高的地区,同时针对中小企业密集的区域补充推理实例,避免单一区域成为瓶颈。
值得关注的是,这轮建设并未采取全部自建的重资产模式。微软与Equinix、Digital Realty等托管运营商的合作在加速,甚至在需求爆发期通过Oracle Cloud Infrastructure的互联来短期承接溢出负载。这种“自建+租赁+伙伴”的混合节奏,让数据中心从动工到交付的周期压缩了30%以上,在GPU一卡难求的2023-2024年抢出了时间窗口。
2. 技术投资重点:自研芯片、液冷与网络重构
摊开微软的技术投入清单,三条线并行推进:自研芯片降低外部依赖,液冷和供电架构应对功率密度暴增,网络互联决定万卡集群的真实效率。
2023年底发布的Azure Maia 100 AI加速器和Cobalt 100 CPU,是微软减少对英伟达单一供应依赖的实质性一步。Maia 100专为端到端AI工作负载优化,从芯片微架构上适配自家的推理和训练管线,虽然现阶段规模仍不能与英伟达H100集群匹敌,但这种“第二货源”的能力让微软在与英伟达等供应商的采购谈判中有了更多议价空间,也避免了架构锁定风险。同时,微软依然维持着与英伟达、AMD的深度合作——这种“自研+多元采购”的并行姿态,是算力供应链安全最务实的解法。
散热和供电则是另一个硬性约束。单机柜数十千瓦的GPU密度,靠传统冷热通道已无法胜任。微软已在部分数据中心部署直接液体冷却方案,并推动2030年实现负碳、正水、零废弃的承诺。这并非成本考量下的选择,而是刚性约束:不解决散热,机柜就塞不进去更多GPU,容量扩张就是一句空话。
网络层面,InfiniBand仍然是微软支撑万卡集群线性扩展的首选,同时针对超以太网的技术探索也在同步进行。微软为OpenAI和自身Copilot构建的超级计算机,互联了数万张GPU,采用的正是定制化网络拓扑,通过减少东西向流量的跳数来降低通信开销。这一层面直接决定了千亿参数模型训练中梯度同步的死锁概率和有效算力比例,是容易被外界忽视却极度烧钱的技术深水区。
3. 合作伙伴生态:以开放接口对冲重资产风险
外界常有误解,认为微软的AI数据中心完全走封闭自建路线,与运营商、托管商形成直接竞争。实际正好相反,微软的合作伙伴网络在这轮扩张中扮演了缓冲层和加速器的双重角色。
一方面,与Equinix等数字基础设施公司深度绑定,可以快速获取现成机房和配套资源,避免从头拿地、建设、环评的漫长流程。另一方面,通过将Azure的算力接口标准化,企业用户可以在Azure门户内调度来自不同物理位置的GPU容量,这种抽象层使得底层无论是自建机房还是合作伙伴机房都做到体验一致,也便于微软灵活调配资金投向。
这种生态开放策略还延伸到数据接入侧。面对工业企业和跨国公司的海量本地数据,微软通过Azure ExpressRoute专线和Data Box离线设备,降低数据导入云端的时延和带宽成本,同时对敏感训练场景叠加Confidential Computing保护。这些动作补齐了“算力强但数据进不来”的短板,让数据中心投资能够更快转化为可服务的客户负载。
四、Azure高性能算力集群的关键技术
外界容易把AI数据中心的建设简化成“采购数万张GPU然后通电”,但实际落地中,最难的部分并不是买到卡,而是让一栋装满加速器的建筑真正以接近线性的效率跑起来。微软近几个财年在Azure基础设施上的资本支出持续高企,管理层多次提到“AI算力需求超过供给能力”,这背后直接反映出,高性能算力集群的规模扩张对芯片选型、互联方案和能效设计三条线同时提出了远超传统云数据中心的压测。
1. 异构加速:GPU、FPGA与自研芯片的组合问题
当前Azure上被用到最多的训练实例,底层仍以英伟达A100和H100 GPU为主,但从整个机群构成来看,微软并不想单一依赖。2023年发布的Azure Maia 100 AI加速器是明确信号——自研芯片主要瞄准云端第一方大模型推理与微调类工作,而非直接替代H100做千亿参数模型的预训练。与此同时,FPGA类资源(例如Intel Arria或Xilinx方案)更多被投向低延迟推理与网络加速管道,而不是大算力训练的主通路。
这里面有一个被反复验证的教训:买更多的GPU并不能带来线性性能提升。微软为OpenAI前期构建的一代超级计算机已经连接了上万张加速卡,但在扩展过程中,超过某个节点数后,跨卡通信开销吞噬了很大一部分算力收益。所以异构加速的核心不再是单颗芯片的纸面算力,而是芯片级的数据通路设计和与网络层的耦合程度。Maia 100之所以选择用全定制的RoCEv2网络直接嵌入加速器,就是为了跳过传统PCIe交换机带来的瓶颈,把节点之间的数据搬移成本压下来。这个思路与英伟达NVSwitch的演进方向一致,只是微软希望自己掌握调度节奏,减少对黑盒依赖。
2. 网络互联:InfiniBand与超以太网的并行演化
当前万卡级训练集群中,InfiniBand依然是事实标准。Azure的NDv5与ND H100 v5系列均配备了高带宽InfiniBand互联,用来保证Ring AllReduce这类通信原语的延迟可控。但这套方案的问题在于价格高、供应商锁定明显,而且当集群规模继续向数万卡乃至更大级别迈进时,传统InfiniBand的拓扑复杂度会急剧上升。
为此,微软内部正并行推进两件事:一是自研定制化网络拓扑,针对MoE这类稀疏大模型的专家并行通信模式,重新设计Clos架构下的流量路径,减少东西向流量过载;二是深度参与超以太网联盟,试图在以太网生态上拉到可对标InfiniBand的时延和拥塞控制水平。预计从下一代集群开始,微软会在部分区域部署基于超以太网的互联方案,优先用在推理和中等规模微调场景,而大型预训练仍然由InfiniBand兜底。这样做的商业逻辑很清楚:不为所有客户承担InfiniBand的溢价,而是按工作负载把网络成本做阶梯化,减少用户在低利用率场景下的无谓支出。
3. 能效优化:液冷不再选配,而是准入门槛
高性能AI集群的单机柜功率密度已经到了传统风冷无法覆盖的区间。按照行业普遍观察,H100集群单柜功耗在40-60千瓦级别,是过去通用服务器机柜的5到8倍。微软在这些新型数据中心里已经不再是“试点”液冷,而是把直接到芯片的冷板式液冷和部分浸没方案作为新建AI产能的标配,部分区域甚至改造了既有风冷机房的供电和管路来兼容更高密度的部署。
这背后的压力来自两个方向。一是运营成本——如果不做液冷,仅压缩机功耗就会让PUE持续恶化,在与AWS和Google Cloud的区域价格对抗中吃亏。二是越来越硬的可持续性承诺。微软公开目标是在2030年实现负碳、正水、零废弃,而AI产能的加速扩张直接拉高了整体电力与水资源消耗量,液冷是缓和这一矛盾的杠杆。目前Azure在瑞典中部等清洁能源富集区域扩容较快,并非偶然,这些地区不仅绿电占比高,而且温度低,能进一步压缩冷却能耗,让大集群的可持续性数字更好看。
五、企业如何利用Azure AI算力?
把高性能GPU集群当成“即开即用的算力池”只是第一步,真正决定AI投入产出比的,是能否把算力、成本、工程效率三者拧在一起做规划。过去两年里跑通了完整训练流水线的团队,几乎没有一家是靠单纯的资源堆叠取胜的。下面从场景匹配、成本结构和训练效率三个维度,拆解当前最具实操价值的打法。
1. 适用场景举例:先选对“武器”再上战场
不同规模的模型,对底层算力形态的要求差异巨大,在这个环节犯错的代价往往是项目周期翻倍。
百亿参数以下微调与LoRA实验:这类任务不需要跨节点通信,单台8卡A100或H100足以在可接受时间内完成一轮训练。对应到Azure上,优先选择NCv4系列(A100)或NDv5单节点配置,开启节点内的NVLink高速互联即可。好处是启动快、调度灵活,不会因为等待大集群资源而排队数天。
千亿参数预训练或大规模MoE模型:单节点算力完全不够,必须构建跨节点的GPU集群,对网络带宽和延迟极度敏感。此时应锁定已部署InfiniBand互联的NDv5或ND H100 v5实例系列,单集群能扩展至数千张GPU,且节点间有200 Gbps以上的低延迟通信。微软为OpenAI构建的超级计算机就是基于此类拓扑,公开信息显示其单集群规模已达数万张卡。
训练数据“上云”阻塞问题:如果训练数据量超过100 TB且位于本地,仅靠公网上传可能需要数周。实操中会启用Azure Data Box离线导入——硬盘寄送至数据中心,由微软灌入Blob存储,再配合ExpressRoute专线做增量同步。这一组合将首轮数据迁移时间压缩到72小时以内,同时避免了跨境带宽成本和合规风险。
操作效果:一家欧洲的ISV在微调其130亿参数语料模型时,先错选了需要整集群预约的NDv5跨节点方案,日均GPU闲置等数据时间超过40%;切换到单节点NCv4并配合数据直连后,实验周期从17天缩短至6天。
2. 成本优化建议:把账单打下来60%不是口号
AI训练成本失控的根源,在于将“实验性负载”当成“稳态生产负载”来采购。把工作负载分层,再对应不同的计费模型,是目前FinOps实践里最见效的一步。
操作说明:
- 拆分任务类型:将需长期运行的预训练任务、可中断的消融实验、短周期的超参搜索彼此隔离。预训练使用一年期预留实例,可获得约40%的折扣;消融实验与超参搜索则放在Spot VM上,价格仅为按需的10%~20%。Spot VM会在资源紧张时被回收,因此代码必须配置检查点自动保存与恢复。
- 配置Spot VM的容错脚本(示例命令): bash
# 创建支持抢占重启的训练作业
az ml job create --file train_spot_job.yml \
--resource-group myRG \
--workspace-name myWS \
--set priority=Spot \
retry_settings.max_retries=5 \
retry_settings.timeout=3600
train_spot_job.yml中定义训练容器与存储卷,配合Azure ML的自动重试机制,节点被回收后会自动在新节点恢复并从最新检查点继续。
- 跨区域动态调度:当美东、西欧等热点区域A100/H100供不应求时,将训练任务拆分为小批次,调度到瑞典中部、英国南部等扩容较快的区域。虽然会增加一些跨区域数据传输延迟,但对于异步数据并行任务,换来的是零排队的即时资源获取。利用Azure Resource Mover或自定义调度器,可以实现基于队列深度的自动区域切换。
效果实测:一家亚洲金融科技团队将70%的实验任务迁移到Spot VM后,单月训练成本从3.2万美元降至1.1万美元;预留实例覆盖长周期训练,又减少约35%支出。唯一需要支付的成本是开发阶段对检查点策略的加固——但只需要一次。
3. 性能调优方法:别让通信开销吃掉你的GPU
计算卡买得再多,如果没有配套的通信优化,64卡之后算力增益就急剧下降。微软Azure CTO在公开访谈中曾透露,千卡以上集群若不做通信优化,有效算力利用率可能跌至40%以下。这不是硬件故障,是分布式训练天生的“木桶效应”。
操作说明:
- 强制使用InfiniBand而非RoCEv2:对于跨节点训练,选择明确标注“IB互联”的实例(如NDv5),并在训练脚本中启用NCCL的IB支持。RoCEv2虽然也能提供高带宽,但在2000卡以上规模时,尾部延迟和丢包重传会导致梯度同步周期拖长2~4倍。
- 并行策略与微批次大小联调:在DeepSpeed或Megatron-LM配置中,将数据并行与模型并行解耦。推荐使用Azure ML的自动超参调优,它会根据集群节点数、每节点GPU数及模型结构,搜索最佳的micro_batch_size与gradient_accumulation_steps组合。一个常用起点:global_batch_size = 1024,micro_batch_size = 8,gradient_accumulation = 16,但需要针对HBM容量动态调整。
- 激活检查点与混合精度:开启Activation Checkpointing将中间激活值换入/换出,减少显存占用;配合BF16混合精度训练,可以在相同GPU数量下将可训练的模型参数规模提升1.7倍左右。部分团队在H100上进一步启用FP8,但需要额外验证数值稳定性。
一个提交分布式训练作业的Azure ML配置片段(简化):
$schema: https://azuremlschemas.azureedge.net/latest/commandJob.schema.json code: ./src command: > deepspeed --num_gpus 32 --num_nodes 4 trainer.py --deepspeed ./ds_config.json --micro_batch_size 8 --gradient_accumulation 16 --bf16 environment: azureml:pytorch-2.0-cuda11.7:latest compute: azureml:ndv5-cluster-4x8
此配置在4台8卡NDv5上运行,全局批次大小为4096。训练脚本内通过DeepSpeed ZeRO-3将模型、优化器状态和梯度分片至32张卡,通信开销被压缩至总时间的18%以下。
效果验证:同一千亿参数模型,直接使用默认数据并行+以太网连接的四节点集群,每秒处理样本数为320;改用InfiniBand互联+DeepSpeed ZeRO-3优化后,同等GPU数量下每秒样本数提升至1870,有效算力利用率从34%跃升至78%。
三个环节做扎实,企业才有资格谈“算力自由”。否则每多花出去的10万美元里,至少有3万是替低效和错配买单。
六、未来趋势与挑战
微软的AI数据中心扩张远未到减速阶段。结合财报、供应链信息和行业技术路线,三个方向的博弈将决定其未来三年能否守住“AI基础设施第一梯队”的位置。
1. 算力需求预测:缺口在转移,而不是消失
表面上看,2024年H100的交付周期已从几个月缩短到几周,似乎供给正在追上需求。但这只是假象。真正的瓶颈正在从“有没有卡”转向“能不能把足够多的卡聚在一起高效运转”。
微软2024财年Q4的资本支出达到190亿美元,几乎全部投向数据中心和AI基础设施。管理层在财报电话会上明确表示,Azure AI服务的增长仍然受制于可用算力,“需求持续超过供给”。但这一次,限制因素不单是GPU硅片——更大瓶颈在网络、电力和冷却能力上。以微软为OpenAI训练GPT-4级别模型构建的超算为例,单集群已互联数万张加速卡。当集群规模从一万卡迈向十万卡,InfiniBand互联的端口密度和信号完整性就会碰到物理天花板,故障域扩大、通信延迟非线性增长将成为首要敌人。
因此,下一阶段算力供给的关键指标不再是“GPU保有量”,而是“万卡以上集群的线性扩展效率”。微软内部已经将定制化网络拓扑和自研DPU视为解决通信瓶颈的方法,这种投入会进一步拉高资本开支门槛。可以预见,具备规模化互联能力的大型云厂商与只能提供浮点算力的中小IDC厂商之间的差距会急剧扩大。对于Azure这样的平台来说,算力缺口的终点不是被填平,而是向更高聚合度、更低通信损耗的超级集群迁移——谁先打通,谁就拿到下一代大模型训练的门票。
2. 可持续发展难题:电力与液冷成为硬约束
过去几年,PUE(电源使用效率)是数据中心炫耀的绿色指标;到了AI时代,这个指标正在失效。单机柜功率密度动辄超过40kW,传统冷板散热已难以招架,微软在现有机房部署液体冷却甚至浸没式冷却已不是实验项目,而是生产环境必须。
更棘手的是电力供给。美国弗吉尼亚州北部这个全球数据中心最密集的区域,电力公司Dominion Energy已经对新的大型数据中心接入请求亮起红灯,甚至暂时中止部分新项目供电。微软选择在瑞典中部、英国南部等扩容较快的区域投放GPU实例,并不完全出于客户距离考虑,而是当地电网尚有承载余量。这种“逐电而建”的模式正在成为选址的核心逻辑。
微软在2020年承诺“2030年负碳、正水、零废弃”,现在这一目标正受到高强度AI扩张的直接冲击。每新增一座万卡集群,年耗电量就相当于数万户家庭的总和。微软通过购买可再生能源证书、签署核电直购协议等方式对冲排放,但电力来源的间歇性与AI训练的7×24需求难以完全匹配。未来24个月,液冷渗透率、自建现场电源的比例以及与能源基础设施的联合投资深度,将是观察微软能否守住可持续承诺的三个硬指标。
3. 竞争格局演变:合作与自研的平衡术
微软在AI算力生态中的站位异常复杂:它既是英伟达最大的客户之一,又是潜在对手;既全力自建数据中心,又从Oracle等竞争对手处租赁容量。这种暧昧的姿态不是战略摇摆,而是刻意维持的弹性。
自研Azure Maia 100 AI加速器和Cobalt 100 CPU在2023年亮相,微软清楚传递了一个信号:对英伟达的依赖必须可控。Maia 100目前主要用于自家Copilot和Azure OpenAI Service内部推理负载,尚未开放给外部客户大规模训练,但这是典型的“先内后外”路径。一旦Maia在特定推理场景下成本效率跑通,微软完全有能力将内部负载迁移,降低外购GPU的比例,掌握定价权。
另一个不可忽略的信号是微软与Oracle的跨云合作。2023年双方宣布Azure可使用基于Oracle Cloud Infrastructure的NVIDIA H100集群,以应对自身的容量不足。这种“敌中有我”的策略在云服务行业历史上少见。它说明微软更在乎最终客户能够拿到算力,而不是算力必须出在自己的机房里。这种开放生态姿态,反而有可能在长期拉拢更多对单一供应商锁定心存戒备的企业客户。
综合来看,微软AI数据中心布局的竞争逻辑不再是“建得最多”,而是“选择最多”——提供从自研芯片到第三方GPU、从自建到租赁的混合方案,用冗余对抗单一供应风险。对那些担心算力锁定的企业来说,这种模式可能会比单纯堆砌GPU数量更具吸引力。
FAQ
Q1:AI数据中心对电力的消耗究竟有多大,会不会缺电?
一个万卡H100集群(满负荷运行)的年耗电量约为1-1.3亿度,相当于约3万户美国家庭的年用电量。目前北美及欧洲的主要云区域电网普遍吃紧,部分地区已暂停新的大型数据中心申请。微软通过选择电力有余量的区域、签订可再生能源长期协议、投资核电等方式保障供电,但电力瓶颈将是长期约束。
Q2:微软自研Maia芯片会完全替代英伟达GPU吗?
短期内不会。Maia 100目前主要承担微软自有AI服务的推理负载,训练任务仍重度依赖英伟达H100及后续B200系列。微软的策略是“推理先用自研,训练保留英伟达”,同时保持与AMD合作,形成三足鼎立格局。这样可以避免供应风险,也在价格谈判中取得更多筹码。
Q3:企业使用Azure GPU时遇到排队,有什么可行的绕过方法?
可以尝试以下三种策略:一是将训练任务迁移到GPU容量较充裕的区域,如瑞典中部、英国南部;二是混合使用Spot VM运行可容错的调参任务,用预留实例保证关键训练的稳定供应;三是通过Azure Machine Learning托管服务自动排队、断点续训,避免人工等待。如果业务允许,也可以选择非高峰时段提交作业,缩短调度时间。
kf@jusoucn.com
4008-020-360


4008-020-360
