블로그

OpenAI-Compatible API 뒤에 어떤 Hugging 얼굴 모형을 실행하는 방법

EmpirioLabs GPU Cloud에서 Hugging Face 모델을 실행

Jun 8, 2026

EmpirioLabs AI

오픈 모델은 빠르게 잡았다. Qwen, DeepSeek, GLM, Kimi 및 Mistral와 같은 랩은 Hugging Face에서 강력한 열린 텍스트 모델을 배송하고 필요한 작업을 많이 제공합니다. 단단한 부분은 결코 모형이었습니다. 그것은 주변에 모든 것: GPU를 찾는, 오른쪽 드라이버를 설치 하 고 서빙 스택, 무게를로드, 포트를 탐험, 그리고 당신의 응용 프로그램에 안정된 연결을 얻을.

GPU Cloud는 그 일을 제거합니다. 관리 GPU를 배포하면 Hugging Face 저장소 ID를 붙여넣고 EmpirioLabs는 OpenAI 호환 엔드포인트 뒤에 모델을 제공합니다. 엔드포인트가 표준 OpenAI API를 사용하므로, SillyTavern, 코딩 조수, 자체 스크립트 또는 공식 OpenAI SDK와 같은 채팅 frontend를 사용할 수 있습니다. 이 가이드는 GPU를 선택하는 방법을 포함하여 전체 흐름을 통해 걸어.

모델 배포

대시보드에서 GPU Cloud 페이지를 열고 모델을 배포하고, 어떤 Hugging Face repository id를 붙여, 예를 들어 Qwen/Qwen3.5-4B 에. GPU를 선택하고 배포합니다. EmpirioLabs는 무게를 다운로드하고, 높은 처리량 서빙 엔진을 시작하고, OpenAI 호환 엔드 포인트에 모델을 노출합니다. 표준 safetensors 모형은 자동적으로 봉사되고, 냉각된 GGUF 저장소는 너무 취급됩니다, 그래서 여분 윤곽 없이 Hugging 얼굴 일에 대부분의 원본 모형.

API에 동일한 일을 할 수 있습니다. 배포 호출은 인스턴스 ID를 상태로 반환합니다 회사연혁. 그것이 될 때까지 인스턴스를 오염 지원하다·.

https://api.empiriolabs.ai/v1/gpu/instances \ -H "Authorization: Bearer $EMPIRIOLABS API KEY" \ -H "Content-Type: application/json " \ -d '{ "gpu slug": "rtx-a6000", "mode": "model", "hf id": " Qwen/Qwen3.5-4B " }'

모델은 몇 분이 걸리며, 무게가 GPU 메모리로 다운로드하고로드 할 수 있기 때문에 첫 번째로 올립니다. 그 후, 인스턴스는 요청을 받을 준비가 되어 있습니다.

올바른 GPU 선택

필요한 GPU를 결정하는 주요 것은 모델이 얼마나 많은 메모리가 걸립니다. 텍스트 모델은 16 비트 정밀도에서 제공되며 억 매개 변수 당 GPU 메모리의 약 2 GB, 컨텍스트 창과 키 값 캐시를위한 헤드 룸. 따라서 7B 모델은 어딘가에 싶어 16 에 20 GB, 30B 모델은 큰 단일 카드를 원, 그리고 70B 모델은 가장 큰 단일 카드 또는 여러 카드 함께. Quantized는 더 작은 GPU에 더 큰 모델이 적합하도록 훨씬 적은 메모리를 사용합니다.

작고 중간 크기의 텍스트 모델에 대한 좋은 기본은 시간 당 0.65 USD에서 48 GB의 RTX A6000입니다. 그것은 충분히 정밀도에 대략 13B까지, 그리고 훨씬 더 큰 것을 실행합니다. 30B의 주위에 모형을 위해, 80 GB를 가진 A100 또는 H100까지 움직입니다. 70B 이상의 경우, 141 GB의 H200을 사용하거나 단일 인스턴스의 여러 GPU를 통해 모델을 분할하면 가장 큰 모델이 제공됩니다. 대쉬보드는 각 GPU의 메모리를 시간당 가격 옆으로 보여줍니다. 모델이 GPU보다 더 많은 메모리를 필요로한다면, 배포가 시작되기 전에 차단됩니다. 따라서 적합 할 수없는 하나에 대해 지불하지 마십시오.

OpenAI 호환 앱에서 사용

이것은 유용합니다. 실행 모델 인스턴스는 다음과 같이 보이는 연결 기본 URL을 제공합니다:

https://api.empiriolabs.ai/v1/gpu/connect/$INSTANCE_ID/v1 에

URL은 OpenAI 기본 URL입니다. OpenAI API와 대화할 수 있는 것은 모델에 대해 이야기할 수 있습니다. 당신은 위의 세 가지 값이 필요합니다: 기본 URL, 당신의 EmpirioLabs API 키는 Bearer 토큰으로, 그리고 당신이 배치하는 정확한 저장소 ID, 예를 들면 Qwen/Qwen3.5-4B 에. 엔드포인트도 답변 /v1/models 에, 그래서 클라이언트는 예상대로 드롭다운 작업을 채우기 위해 모델 목록을 fetch.

curl https://api.empiriolabs.ai/v1/gpu/connect/$INSTANCE_ID/v1/chat/completions \ -h "권한: 보유자 $EMPIRIOLABS_API_KEY" \ -h "콘텐츠-유형: application/json" \ -d '{ "model": "Qwen/Qwen3.5-4B", "messages": [{ "role": "user", "content": "Hello" }] }''

OpenAI SDK를 선호한다면, 같은 연결 경로와 다른 모든 것들에 기본 URL이 동일하게 유지됩니다

openai import OpenAI client = OpenAI(base url=" https://api.empiriolabs.ai/v1/gpu/connect/INSTANCE_ID/v1", api key="YOUR EMPIRIOLABS API KEY",) 응답 = client.chat.completions.create(model=" Qwen/Qwen3.5-4B ", message=[{"role": "user", "content": "Hello"}],) print(response.choices[0].mesage.content.content

같은 세 가지 값은 이미 사용중인 도구로 연결합니다. SillyTavern, Open WebUI, 또는 LibreChat과 같은 채팅 프론트엔드에서 OpenAI 호환 또는 사용자 정의 공급자를 선택하여 API URL을 연결 기본 URL로 설정하고 EmpirioLabs API 키를 붙여넣고, 인스턴스에 표시된 모델명을 입력합니다. Cline, Continue, Aider와 같은 사용자 정의 OpenAI 기본 URL을 수용하는 코딩 조수는 동일한 방법을 구성합니다. 롤플레이 프론트엔드, 에이전트 프레임 워크, 분산 파이프라인, 그리고 어떤 사내 서비스는 같은 패턴을 따릅니다: 기본 URL, 키, 모델.

대시보드에서 채팅

외부 도구가 필요없는 모델만 배포할 수 있습니다. OpenAI-compatible API를 제공하는 모든 인스턴스는 내장 채팅 페이지를 가져옵니다. GPU Cloud 페이지에서 인스턴스를 열고, 이 모델과 채팅을 클릭하고 입력을 시작합니다. 채팅 페이지 스트림 응답, 시스템 프롬프트 및 일반 샘플링 컨트롤을 지원, API와 같은 보안 연결을 실행, 그래서 설정하고 별도 청구를 설정하는 추가 아무것도 없다, 인스턴스가 이미 두 번째로 미터.

그것을 사용하지 않을 때 일시 중지

GPU Cloud는 실행 시간의 두 번째 당 청구되며 배포 할 때 시간당 속도가 잠겨 있으므로 가격 변경은 이미 실행중인 인스턴스에 영향을 미치지 않습니다. 모델을 필요로 할 때, 인스턴스를 중지합니다. GPU를 출시하고 즉시 청구를 중지합니다. 나중에 다시 시작하고 EmpirioLabs는 다음 가능한 GPU에서 동일한 모델을 확보합니다. Stopping clears the example's ephemeral storage, 그래서 스크래치 공간으로 그것을 대우, 당신은 그것으로 끝날 때 인스턴스를 파괴. 평생 및 per-instance 지출은 GPU 클라우드 페이지에서 볼 수 있으며 /v1/account/usage 에·.

시작하기

기타 GPU 클라우드 대시보드에서 첫 번째 모델을 배포하거나, 읽기 GPU 클라우드 문서 전체 API의 경우.

더 나은 엔드포인트를 사용할 준비가 되셨나요?

저희 모델을 탐색하시거나, 비즈니스 문의, 맞춤형 배포 또는 기타 어떤 사항이든 문의해 주세요.