首页 博客

如何在 OpenAI 兼容 API 背后运行任何牵引面模

在 EmpirioLabs GPU 云上运行任何拥抱面部模型

Jun 8, 2026

EmpirioLabs AI

公开型号的追赶速度很快. Quen, DeepSeek, GLM, Kimi,和Mistral等实验室在Hugging Face上不断运输强大的开放文本模型,对于很多工作来说,它们都是你所需要的. 难点从来就是模特儿 找到一个GPU, 安装正确的驱动器和服务堆栈, 加载重量, 暴露一个端口, 和获得稳定的连接回你的应用.

GPU Cloud删除了这个工作. EmpirioLabs为OpenAI兼容端点背后的模型服务。 由于端点会说标准OpenAI API,因此可以指向它几乎所有的工具:像SillyTavern这样的聊天前端,一个编码助理,你自己的脚本,或者官方的OpenAI SDKs. 这个指南贯穿整个流程,包括如何选择一个GPU.

部署模型

在仪表盘中打开 GPU 云页, 选择部署一个模型, 粘贴任何 Hugging Face 寄存器 ID, 例如 Qwen/Qwen3.5-4B (英语)选择一个GPU,然后部署。 EmpirioLabs下载权重,启动高通量服务引擎,并在OpenAI兼容端点上曝光模型. 标准的安全器模型会自动服务,并且对量化的GGUF寄存器也进行处理,因此大多数关于Hugging Face的文本模型在没有附加配置的情况下工作.

你也可以通过API做同样的事情. 部署呼叫返回一个实例编号,状态为 供给. 调查案件直到 运行。 。 。.

卷 https://api.empiriolabs.ai/v1/gpu/instances ~~~H "授权:熊熊 $EMPRIOLABS API KEY"=~H "联系: application/json "==================================================================================== (====================================================================================================================

一个模型第一次出现需要几分钟时间,因为重量需要下载和加载到GPU内存中. 在此之后,法院准备接受请求.

选择正确的 GPU

决定你需要哪个GPU的主要内容是模型需要多少内存. 一个16位精度的文本模型每十亿参数需要大约2GB的GPU内存,外加上下文窗口和密钥值缓存的头室. 因此,一个7B型号想要在16到20GB左右的某个地方,一个30B型号想要一个大的单张卡,一个70B型号想要一个最大的单张卡或者几个卡在一起. 量子化的建筑使用的内存要少得多,这使得一个更大的模型适合一个较小的GPU.

中小型文本模型的一个很好的默认是RTX A6000,48GB,每小时0.65美元. 它完全精准地运行着大约13B的模型,当它们被量化时运行的则更大。 对于30B左右的型号,以80GB移动至A100或H100. 对于70B及以上,使用一个带有141GB的H200,或者在一次中将模型分成几个GPU,这就是最大模型的服务方式. 仪表盘显示每个GPU的内存与小时价格相邻,如果一个模型需要比您选择的GPU更多的内存,部署在开始前就被屏蔽了,所以你从不支付无法适应的内存.

在任何 OpenAI 兼容的应用程序中使用

这就是它变得有用的地方。 一个运行中的模型实例会给你一个这样的连接基URL:

https://api.empiriolabs.ai/v1/gpu/connect/$INSTANCE_ID/v1 (英语)

这个URL是一个滴入OpenAI基础URL. 能和OpenAI API交谈的任何东西都可以和你的模型交谈. 您需要三个值: 上方的基础 URL, 您的 EmpirioLabs API 密钥作为无记名符号, 以及模型名称, 这是您部署的确切寄存器 ID, 例如 Qwen/Qwen3.5-4B (英语)。终点也回答 /v1/models (英语),因此获取模型列表的客户端可以按预期完成一个下拉工作.

卷 https://api.empiriolabs.ai/v1/gpu/connect/$INSTANCE_ID/v1/chat/completions ==-H "授权:熊鼠$EMPRIOLABS API KEY"=========================================================================================================================================================================================

如果您更喜欢OpenAI SDK,请将其基址点到相同的连接路径上,其他一切保持不变:

从 Openai 导入 OpenAI 客户端 = OpenAI (base url=" https://api.empiriolabs.ai/v1/gpu/connect/INSTANCE_ID/v1", api key="YOUR EMPRIIOLABS API KEY",) 响应 = 客户端. chat.creates.create(模型=" Qwen/Qwen3.5-4B),消息 = [{作用]:"用户","内容":"你好"},) print(response.choices [0].message.content)

在您已经使用的工具中插入相同的三个值 。 在SillyTavern, Open WebUI, 或 LibreChat 等聊天前端选择 OpenAI 兼容或自定义提供者, 将 API URL 设置到您的连接基址, 粘贴您的 EmpirioLabs API 键, 并输入实例中显示的模型名 。 接受自定义的 OpenAI 基础 URL 的编码助理,如 Cline, Clue, 和 Aider, 配置方式相同 。 角色扮演前端,代理框架,检索管道,以及任何内部服务都遵循相同的模式:基址,密钥,模型.

在仪表板上聊天

您不需要外部工具来尝试刚刚部署的模型 。 每个为 OpenAI 兼容的 API 服务的实例都会获得内置聊天页面. 从 GPU 云页面打开实例, 用此模式点击聊天, 并开始打字 。 聊天页面流响应,支持一个系统即时和通常的采样控制,并运行在与API相同的安全连接上,因此没有额外的设置,也没有单独的计费,因为实例已经被第二个计费.

不使用时暂停

GPU Cloud每秒运行时间计费,部署时计时率会锁定,因此价格变动永远不会影响已经运行的实例. 不需要模型时,请停止实例. 释放GPU 并立即停止计费。 稍后再次启动,EmpirioLabs在下一个可用的GPU上重新部署相同的模型. 停止清除实例的麻黄储存, 所以把它当作刮痕空间, 并摧毁一个实例 当你完成它。 在GPU云页面和通过中可以看到生活时间和常年开支 /v1/account/usage (英语)。 。 。.

开始吧

打开 GPU 云层 在仪表板上部署第一个模型,或者读取 GPU 云文档 整个API.

准备好使用更好的终端了吗?

欢迎浏览我们的模型,或联系我们洽谈业务咨询、定制部署或其他任何事宜。