返回新闻列表
2026-05-22 11:05

​亚马逊 SageMaker AI 推出兼容 OpenAI API 的实时推理端点

文本核心速览
  1. 新增 OpenAI 兼容 API亚马逊 SageMaker AI 实时推理端点开放 /openai/v1 路径,支持聊天补全请求及流式输出。用户仅需更改端点 URL,即可通过 OpenAI SDK、LangChain 等工具直接调用模型,无需重写代码。
  2. 多模型托管与共享访问用户可在同一 SageMaker AI 端点上托管 Llama、微调 Mistral 等多个模型,所有模型通过相同的 OpenAI SDK 访问,便于构建多步骤 AI 代理工作流。
  3. 简化 Bearer Token 认证SageMaker AI 端点采用 Bearer Token 认证,SageMaker Python SDK 内置 Token 生成工具,简化了认证流程,确保用户安全便捷地访问推理服务。

改个 URL 就能用 OpenAI 接口:SageMaker AI 悄悄挂上了 /openai/v1

亚马逊 SageMaker AI 今天悄悄在实时推理端点上挂了一个 /openai/v1 路径,用户把代码里的 API 端点 URL 一改,就能用 OpenAI SDK、LangChain 或 Strands Agents 直接调用 SageMaker 上的模型,不必写 SigV4 签名也不用重写客户端逻辑。有开发者试了说,这简直是给 OpenAI 用户开的后门——原本要封装一层认证的破事全免了,流式输出也直接走通。

兼容 API

所有标准 SageMaker AI API 和 SDK 创建的端点和推理组件都已经原生支持这个 OpenAI 端点。群里在传,改个端点 URL 后,现有的应用连代码都不用动,无缝接入。SageMaker AI 本身支持在自家基础设施上构建多步骤 AI 代理工作流,比如用 Strands Agents 或 LangChain 搭的代理,现在可以直接用原有的 OpenAI 接口调用推理,而实际跑在用户自己的 GPU 实例 上——等于把 OpenAI 的调用习惯搬到了自托管环境里。

多模型托管

同一个 SageMaker AI 端点上可以塞多个模型:通用任务用 Llama、特定行业用微调过的 Mistral、分类用轻量小模型,所有模型都能通过同一个 OpenAI SDK 访问。有开发者试了说,这比之前每个模型开一个终端要省心得多,也省了不少实例开销。

认证与部署

要用这个功能,前提条件得备齐:AWS 账户和对应权限、装好 SageMaker 和 OpenAI 的 Python SDK、模型要提前扔到 S3 存储桶里。认证走 Bearer Token,SageMaker Python SDK 里自带生成 Token 的工具,不用手写签名逻辑。实际部署时,用户可以轻松拉起单模型端点或者推理组件端点(后者适合多模型共用一个端点)。官方文档里写的是“简化认证流程”,用户社区的实际反馈是“少掉头发”。


接下来盯着看:这个更新让那些买了 OpenAI API 但嫌贵的团队直接转向 AWS 自家 GPU,最难受的可能是其他云厂商的推理托管服务,特别是还死守着专有 API 的那几家。哪个先跟牌、哪个死扛,会直接影响今年 Q2 的 AI 基础设施格局。

来源: aibase阅读原文

其他新闻

查看全部