亚马逊 SageMaker AI 推出兼容 OpenAI API 的实时推理端点
- 新增 OpenAI 兼容 API—亚马逊 SageMaker AI 实时推理端点开放 /openai/v1 路径,支持聊天补全请求及流式输出。用户仅需更改端点 URL,即可通过 OpenAI SDK、LangChain 等工具直接调用模型,无需重写代码。
- 多模型托管与共享访问—用户可在同一 SageMaker AI 端点上托管 Llama、微调 Mistral 等多个模型,所有模型通过相同的 OpenAI SDK 访问,便于构建多步骤 AI 代理工作流。
- 简化 Bearer Token 认证—SageMaker AI 端点采用 Bearer Token 认证,SageMaker Python SDK 内置 Token 生成工具,简化了认证流程,确保用户安全便捷地访问推理服务。
改个 URL 就能用 OpenAI 接口:SageMaker AI 悄悄挂上了 /openai/v1
亚马逊 SageMaker AI 今天悄悄在实时推理端点上挂了一个 /openai/v1 路径,用户把代码里的 API 端点 URL 一改,就能用 OpenAI SDK、LangChain 或 Strands Agents 直接调用 SageMaker 上的模型,不必写 SigV4 签名也不用重写客户端逻辑。有开发者试了说,这简直是给 OpenAI 用户开的后门——原本要封装一层认证的破事全免了,流式输出也直接走通。
兼容 API
所有标准 SageMaker AI API 和 SDK 创建的端点和推理组件都已经原生支持这个 OpenAI 端点。群里在传,改个端点 URL 后,现有的应用连代码都不用动,无缝接入。SageMaker AI 本身支持在自家基础设施上构建多步骤 AI 代理工作流,比如用 Strands Agents 或 LangChain 搭的代理,现在可以直接用原有的 OpenAI 接口调用推理,而实际跑在用户自己的 GPU 实例 上——等于把 OpenAI 的调用习惯搬到了自托管环境里。
多模型托管
同一个 SageMaker AI 端点上可以塞多个模型:通用任务用 Llama、特定行业用微调过的 Mistral、分类用轻量小模型,所有模型都能通过同一个 OpenAI SDK 访问。有开发者试了说,这比之前每个模型开一个终端要省心得多,也省了不少实例开销。
认证与部署
要用这个功能,前提条件得备齐:AWS 账户和对应权限、装好 SageMaker 和 OpenAI 的 Python SDK、模型要提前扔到 S3 存储桶里。认证走 Bearer Token,SageMaker Python SDK 里自带生成 Token 的工具,不用手写签名逻辑。实际部署时,用户可以轻松拉起单模型端点或者推理组件端点(后者适合多模型共用一个端点)。官方文档里写的是“简化认证流程”,用户社区的实际反馈是“少掉头发”。
接下来盯着看:这个更新让那些买了 OpenAI API 但嫌贵的团队直接转向 AWS 自家 GPU,最难受的可能是其他云厂商的推理托管服务,特别是还死守着专有 API 的那几家。哪个先跟牌、哪个死扛,会直接影响今年 Q2 的 AI 基础设施格局。