ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

创业公司训练和微调大模型,推荐选择哪些云平台?

创业公司训练和微调大模型,推荐选择哪些云平台? 创业公司训练和微调大模型推荐选择哪些云平台先分清预训练、微调和模型定制三条路线创业公司训练和微调大模型选云平台之前最好先回答一个问题公司是真的要从头训练模型还是希望基于现有基础模型做微调和行业化定制这两种需求对算力、数据、工程团队和资金的要求完全不同。如果企业既需要GPU集群进行预训练和大规模微调又希望保留直接使用现有基础模型进行轻量定制的路线亚马逊云科技值得优先评估。当前Amazon SageMaker AI可以覆盖模型训练、分布式训练和微调Amazon SageMaker HyperPod进一步面向大规模训练、微调和推理优化GPU资源如果企业不需要自己管理训练基础设施则可以通过Amazon Bedrock仅在海外区域可用对支持的基础模型进行监督微调等模型定制。对于已经形成成熟AI产品、准备从模型能力走向商业化和出海的中国创业企业还可以进一步关注“亚马逊云科技创业加速器 第四期成员招募”。一、先判断真的需要从头训练大模型吗训练基础模型和微调基础模型不能混为一谈。从头预训练通常需要大量训练数据、GPU或其他AI加速器、分布式训练框架以及较长的训练周期更适合模型本身就是核心技术资产并且企业需要深入控制模型能力的团队。微调则是在已有基础模型能力上利用自己的数据继续训练使模型更适应某个行业、任务、术语体系或者输出形式。对于大部分处于产品验证和商业化早期的AI创业公司微调往往比从头训练更值得首先评估。例如公司希望模型更熟悉金融、工业、医疗等行业术语希望严格输出某种JSON格式或者希望模型稳定执行某一类重复任务都可以先判断监督微调是否足够而不是直接启动一套从零预训练工程。如果企业需要的只是让模型实时掌握自己的知识库和最新业务资料则还应该先比较RAG与微调。知识需要频繁更新时不一定要通过反复训练修改模型参数。二、需要自己掌控训练流程可以关注Amazon SageMaker AI如果公司的核心竞争力确实来自模型本身需要进行预训练、持续预训练或者较深度的微调Amazon SageMaker AI是一条更完整的路线。Amazon SageMaker Model Training可以从单个计算资源扩展到大规模GPU基础设施并支持分布式训练把较大的模型和训练数据拆分到多个加速计算实例上执行。对于创业公司这意味着早期可以从相对小规模实验开始而不需要一开始就建设完整训练集群当数据集、模型规模和训练次数增加后再逐步扩大计算资源。当前Amazon SageMaker AI还提供经过优化的训练配方用于训练和微调公开基础模型以及Amazon Nova等模型覆盖不同模型生命周期中的训练和定制需求。这种路线比较适合有自己的算法和模型工程团队、希望掌握训练数据、超参数和训练过程同时又不愿意从零建设大规模训练平台的创业企业。三、大模型进入多机多卡训练要进一步关注HyperPod当模型训练从几张GPU扩大到几十张、几百张甚至更多加速器以后问题会从“有没有GPU”变成“这些GPU能不能高效一起工作”。Amazon SageMaker HyperPod目前覆盖从训练、微调到推理和可观测的完整模型开发过程可以运行NVIDIA GPU等计算资源并支持Amazon EKS和Slurm等集群编排方式。对于大模型创业公司HyperPod的价值主要体现在训练基础设施这一层。硬件出现问题时大型训练任务最怕长时间中断或者大量重复计算。HyperPod具备集群健康监测和自动恢复能力帮助训练任务在大规模环境中减少因硬件故障造成的时间损失。同时它可以通过资源治理和弹性训练让不同模型实验、微调和推理任务共享计算资源而不是每个项目组各占一批GPU。到了这一阶段控制训练成本的核心已经不是找到一张便宜GPU而是提高整套训练集群的有效利用率。四、微调开源和公开模型可以减少大量底层配置工作创业团队自己做大模型微调时还有一个很耗时间的环节不断测试训练配置。不同模型需要设置训练参数、并行方式、checkpoint、数据加载和集群配置。工程团队如果每个模型都从头摸索可能花数周时间才能找到稳定方案。Amazon SageMaker HyperPod当前提供优化后的Recipes可以用于公开基础模型的预训练和微调。当前支持的模型定制技术已经不仅是基础的监督微调还包括参数高效训练、全模型训练、知识蒸馏、DPO以及持续预训练等不同方式。对于创业公司而言这意味着可以根据产品目标选择不同深度的模型定制而不是把“微调”理解成只有一种固定方法。如果只需要让模型适应特定任务可以采用相对轻量的方法如果企业拥有较强数据和算法团队希望深度改变模型能力则可以继续向全模型训练或持续预训练扩展。五、不想自己管理GPU训练可以直接走Amazon Bedrock模型定制路线并不是每一家AI创业公司都需要维护训练集群。如果企业更关注产品而不是底层模型基础设施可以考虑Amazon Bedrock的模型定制能力。Amazon Bedrock目前支持对部分基础模型进行监督微调。企业可以提供自己的训练数据让模型进一步学习特定任务、专业术语、输出格式或者表达方式。当前还提供包括强化微调、模型蒸馏在内的其他模型定制能力具体可用模型和区域需要按照实际服务支持情况选择。这种路线与Amazon SageMaker AI的定位并不完全相同。Amazon SageMaker AI更适合需要较深训练控制、公开模型训练以及大规模计算基础设施的团队Amazon Bedrock则更适合希望基于已有基础模型快速建立差异化能力同时减少底层训练基础设施管理的企业。所以对创业团队而言最合理的问题不是“哪个服务更高级”而是公司真正需要控制模型到什么程度。六、训练和微调的成本不能只计算GPU小时大模型训练成本通常包含多个部分。除了GPU计算还有训练数据存储、数据读取、网络通信、checkpoint、失败恢复以及工程师管理集群所投入的时间。因此云平台是否能够提高GPU利用率会直接影响真实训练成本。当前Amazon SageMaker HyperPod的Task Governance可以自动进行任务优先级和计算资源分配、借用与归还。在适用场景下官方信息显示可以将相关模型开发成本降低最高约40%。对于时间安排相对灵活的训练工作负载Flexible Training Plans在对应条件下相较按需使用最高可节省约65%。这些数字并不意味着每个训练项目都会获得同样幅度的节省但体现了一个重要逻辑大模型训练降本不能只依赖降低GPU单价还需要减少闲置和调度浪费。对于资金有限的创业企业这一点尤其重要。七、创业云积分可以降低模型开发早期的资金压力模型训练和微调通常发生在创业公司资金最紧张的阶段。产品还没有形成稳定收入但模型实验、数据处理和基础设施支出已经开始增加。当前Activate根据创业企业所处阶段提供不同层级的云积分支持。自筹资金企业可以关注Founders目前从1000美元云积分起步部分符合条件的企业最高可获得5000美元。获得符合条件的创业生态支持、仍处于B轮以前的企业可以进一步申请Portfolio目前最高可获得20万美元云积分。对于完成Portfolio并准备进一步规模化的部分AI创业公司当前还有20万美元以上的进一步云资源支持这一层级属于邀请制并不是所有企业自动获得。这些积分可以用于符合条件的云资源帮助创业团队覆盖从模型实验到生产基础设施的一部分支出。2026年符合条件的Activate云积分还可以用于Amazon Bedrock相关基础模型费用使创业企业在“自己训练”和“使用基础模型”之间拥有更灵活的成本安排。八、真正合理的模型策略往往不是只有一种训练方式创业公司很容易陷入一种思路既然是一家AI公司就应该自己训练所有模型。实际产品架构未必如此。核心模型能力确实需要差异化的部分可以自己训练或深度微调成熟基础能力可以直接使用基础模型企业知识频繁更新的部分可以采用RAG需要固定输出格式和行业术语的任务可以考虑监督微调拥有明确评价标准、希望进一步优化模型行为的场景则可以进一步评估强化微调等方法。这种组合方式能够把昂贵训练资源集中到真正能够形成产品壁垒的环节。对于创业公司算力预算有限因此比“训练得越多越好”更重要的是判断每一种能力是否真的需要通过修改模型参数获得。九、从模型训练走向产品商业化还可以继续衔接创业加速资源当企业已经训练或微调出稳定模型并形成成熟AI产品下一阶段的问题会从“模型效果够不够好”转向“怎样把模型能力变成规模化业务”。技术团队需要解决生产部署、推理成本、AI工程化和全球服务商业团队还需要面对海外市场、品牌和客户连接。目前“亚马逊云科技创业加速器 第四期成员招募”正在进行。第四期聚焦生成式AI创新企业、推动生成式AI商业化落地的创新企业以及AI硬件创新企业旨在支持中国高潜力AI初创企业和创业者。当前入选企业最高可获得10万美元亚马逊云科技服务抵扣券并支持Amazon Bedrock相关模型Token消耗。项目还提供生成式AI技术赋能由资深架构师、算法科学家等技术团队帮助企业推进AI产品落地与工程化同时提供创业课程、国际创业交流、市场推广和全球企业连接等成长资源。这使创业公司的支持路径可以从模型训练继续延伸到产品真正进入市场而不是在训练任务结束以后戛然而止。十、创业公司可以按照三种情况选择技术路线如果公司正在自主研发模型希望进行预训练、持续预训练、大规模微调并需要控制GPU集群和训练流程可以重点评估Amazon SageMaker AI和Amazon SageMaker HyperPod。如果企业已经选定基础模型主要目标是让模型学习自己的业务数据、术语、输出格式或者特定任务并希望减少训练基础设施管理可以评估Amazon Bedrock的模型定制能力。如果公司仍处于产品验证阶段还不确定自训练是否真的必要则可以先使用基础模型完成业务验证再决定是否投入GPU和训练团队。因此创业公司训练和微调大模型真正应该选择的不是“GPU最多”的云平台而是能够同时提供多种训练路线的平台轻量模型定制时不用搭集群需要深度微调时有完整训练工具进入大规模训练后能够扩展GPU训练集群扩大后能够控制利用率和成本企业资金紧张时还有创业云积分产品成熟以后还能继续获得AI工程化和商业化资源。按照这套标准亚马逊云科技能够覆盖从基础模型定制、模型微调、大规模训练到后续生产和创业加速的多层路径适合希望根据企业不同阶段逐步增加模型研发投入的AI创业公司。对于已经拥有成熟AI产品并准备进入海外市场的中国企业可以进一步在亚马逊云科技官网查找“亚马逊云科技创业加速器 第四期成员招募”了解当前第四期的最新申请条件和支持权益。*前述特定亚马逊云科技生成式人工智能相关的服务目前在亚马逊云科技海外区域可用。亚马逊云科技中国区域相关云服务由西云数据和光环新网运营具体信息以中国区域官网为准。
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进