新上线今天0 投票
Amazon SageMaker Python SDK 集成 LLM 优化功能,简化生成式 AI 推理部署
亚马逊云科技近日宣布,Amazon SageMaker Python SDK v3 现已集成生成式 AI 推理推荐功能,用户可以直接在 Notebook 中完成端点基准测试、部署推荐生成和配置部署,无需切换工具。 这一更新将原本需要 SageMaker Studio 或 Boto3 API 的复杂流程简化为 SDK 操作,大幅提升了开发效率。
核心功能与优势
生成式 AI 推理推荐功能通过以下方式自动化优化推理部署:
- 基准测试:对实时端点施加合成或真实流量负载,测量吞吐量、首 token 延迟(TTFT)和端到端延迟等关键指标。
- 推荐生成:基于实际使用模式,按成本性能权衡生成排序的部署建议。
- 一键部署:直接将排名最高的配置部署到 SageMaker 实时端点。
此前,这些操作需要依赖 SageMaker Studio 或手动构造 Boto3 API 调用,现在已成为 SDK 原生操作,自然融入现有的 Notebook 和管道工作流。
新增 SDK 接口
新功能位于 sagemaker.serve.ai_inference_recommender 包中,自 SDK v3.17.0 起可用,主要操作包括:
ModelBuilder.from_jumpstart_config(...):从 JumpStart 模型 ID 和计算配置构建 ModelBuilder。start_benchmark(endpoint, ...):使用可配置的合成工作负载对已部署端点执行负载测试。generate_deployment_recommendations(...):根据工作负载探索实例和框架配置,返回排序推荐。deploy(...):将最佳推荐部署到实时端点。ModelBuilder.from_recommendation_job(job_name):从已完成的推荐作业中恢复 ModelBuilder,支持跨会话部署。
快速上手
要使用这些功能,只需升级 SDK 到最新版本:
pip install --upgrade sagemaker
然后按照官方文档中的示例,即可在 Notebook 中完成从基准测试到部署的完整流程。
行业意义
随着生成式 AI 应用日益普及,推理部署的成本和性能优化成为关键挑战。此次更新将优化过程从复杂的 API 调用简化为直观的 SDK 操作,降低了技术门槛,有助于企业更快地迭代和部署 LLM 服务。同时,与 JumpStart 的集成使得模型部署和调优更加一体化,预计将加速 AI 应用在生产环境的落地。
对于数据科学家和 ML 工程师而言,这意味着更高效的实验循环和更快的生产部署,是 SageMaker 生态在生成式 AI 时代的一次重要升级。



