Amazon SageMaker Feature Store 新增批量写入与记录发现 API
批量写入与记录发现:Amazon SageMaker Feature Store 新 API 解析
在机器学习平台的发展中,两个常见的操作痛点一直困扰着开发者:一是高吞吐量特征管道的写入效率,二是内存存储层中记录的可发现性。近日,Amazon SageMaker Feature Store 推出两项新 API——BatchWriteRecord 和 ListRecords,旨在解决这些问题。
批量写入:告别循环调用
以往,向在线存储写入特征数据需要循环调用 PutRecord,每条记录、每个特征组都需要一次 API 调用。以每秒处理 10,000 条记录的欺诈检测管道为例,若涉及五个特征组,则需维持每秒 50,000 次 API 调用,这无疑增加了连接开销并限制了吞吐量。
BatchWriteRecord API 允许用户在一次调用中跨多个特征组写入最多 25 条记录,并支持部分成功语义、每条记录的 TTL 控制,以及与 PutRecord 相同的基于 EventTime 的排序保证。这能显著降低 API 调用次数,提升写入效率。
记录发现:让数据可被枚举
对于使用 In-Memory 存储层的团队,此前无法浏览或枚举在线存储中的记录。若因 bug 或管道故障导致记录标识符丢失,这些记录将永久不可恢复,因为没有离线存储可回退,也无法通过 Athena 查询或 API 发现。
ListRecords API 支持对特征组内的记录标识符进行分页枚举,适用于标准(基于 Amazon DynamoDB)和 In-Memory(基于 Redis)两种存储层。这为数据恢复和治理提供了新的可能性。
快速开始
要使用这些 API,您需要拥有 AWS 账户并配置相应权限。最小 IAM 策略需包含 sagemaker:BatchWriteRecord、sagemaker:PutRecord 和 sagemaker:ListRecords 权限。官方博客提供了详细的代码示例,帮助您快速上手。
这两项新 API 标志着 SageMaker Feature Store 在操作效率和数据可管理性上的重要进步,对于大规模 ML 平台而言,无疑是值得关注的新工具。
