SheepNav
新上线今天0 投票

Amazon SageMaker Python SDK 集成 LLM 优化功能,简化生成式 AI 推理部署

亚马逊云科技近日宣布,Amazon SageMaker Python SDK v3 现已集成生成式 AI 推理推荐功能,用户可以直接在 Notebook 中完成端点基准测试、部署推荐生成和配置部署,无需切换工具。 这一更新将原本需要 SageMaker Studio 或 Boto3 API 的复杂流程简化为 SDK 操作,大幅提升了开发效率。

核心功能与优势

生成式 AI 推理推荐功能通过以下方式自动化优化推理部署:

  • 基准测试:对实时端点施加合成或真实流量负载,测量吞吐量、首 token 延迟(TTFT)和端到端延迟等关键指标。
  • 推荐生成:基于实际使用模式,按成本性能权衡生成排序的部署建议。
  • 一键部署:直接将排名最高的配置部署到 SageMaker 实时端点。

此前,这些操作需要依赖 SageMaker Studio 或手动构造 Boto3 API 调用,现在已成为 SDK 原生操作,自然融入现有的 Notebook 和管道工作流。

新增 SDK 接口

新功能位于 sagemaker.serve.ai_inference_recommender 包中,自 SDK v3.17.0 起可用,主要操作包括:

  • ModelBuilder.from_jumpstart_config(...):从 JumpStart 模型 ID 和计算配置构建 ModelBuilder。
  • start_benchmark(endpoint, ...):使用可配置的合成工作负载对已部署端点执行负载测试。
  • generate_deployment_recommendations(...):根据工作负载探索实例和框架配置,返回排序推荐。
  • deploy(...):将最佳推荐部署到实时端点。
  • ModelBuilder.from_recommendation_job(job_name):从已完成的推荐作业中恢复 ModelBuilder,支持跨会话部署。

快速上手

要使用这些功能,只需升级 SDK 到最新版本:

pip install --upgrade sagemaker

然后按照官方文档中的示例,即可在 Notebook 中完成从基准测试到部署的完整流程。

行业意义

随着生成式 AI 应用日益普及,推理部署的成本和性能优化成为关键挑战。此次更新将优化过程从复杂的 API 调用简化为直观的 SDK 操作,降低了技术门槛,有助于企业更快地迭代和部署 LLM 服务。同时,与 JumpStart 的集成使得模型部署和调优更加一体化,预计将加速 AI 应用在生产环境的落地。

对于数据科学家和 ML 工程师而言,这意味着更高效的实验循环和更快的生产部署,是 SageMaker 生态在生成式 AI 时代的一次重要升级。

延伸阅读

  1. 为什么普通人不用AI代理?
  2. ICE DNA采集激增、SpaceX火箭撞月与AI反弹浪潮
  3. 美国AI安全法规或为黑客提供优势
查看原文