
정밀한 듀얼 타워 립싱크와 함께 한 추론 단계에서 동기화된 비디오와 오디오를 생성하는 오픈 소스 32B MoE 기초 모델입니다.
정밀한 듀얼 타워 립싱크와 함께 한 추론 단계에서 동기화된 비디오와 오디오를 생성하는 오픈 소스 32B MoE 기초 모델입니다.
다른 이름 OpenMOSS MOSS Video and Audio
moss-video-and-audio/v1/videos/generationsmoss-video-audioopenmoss/video-audioEmpirioLabs 카탈로그의 실시간 종량제 요금입니다. 사용한 만큼만 결제하며 월 최소 요금이 없습니다.
MOSS Video and Audio은(는) POST /v1/videos/generations로 실행됩니다. 요청은 즉시 job_id를 반환하며, 작업이 완료될 때까지 GET /v1/jobs/{job_id}을 폴링한 뒤 결과에서 출력 URL을 읽으세요. EmpirioLabs 대시보드에서 API 키를 발급받으세요.
curl https://api.empiriolabs.ai/v1/videos/generations \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "moss-video-and-audio",
"prompt": "Describe what you want MOSS Video and Audio to generate."
}'curl https://api.empiriolabs.ai/v1/jobs/JOB_ID \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY"import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/videos/generations",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={
"model": "moss-video-and-audio",
"prompt": "Describe what you want MOSS Video and Audio to generate.",
},
)
job = response.json()
# Generation runs as an async job. Poll until it completes.
import time
while True:
status = requests.get(
f"https://api.empiriolabs.ai/v1/jobs/{job['job_id']}",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
).json()
if status.get("status") in ("completed", "failed"):
print(status)
break
time.sleep(5)EmpirioLabs에서 MOSS Video and Audio API가 지원하는 요청 파라미터입니다. 필드를 생략하면 기본값이 적용됩니다.
| 파라미터 | 유형 | 기본값 | 범위 / 값 | 설명 |
|---|---|---|---|---|
| prompt | string | - | - | 장면 설명. 이미지가 첨부되면 image-to-video 프롬프트가 됩니다. |
| mode | enum | t2v | t2v, i2v | T2V: 순수 text-to-video. i2V: 첨부된 이미지를 애니메이션으로 만드세요. |
| resolution | enum | 720p | 360p, 720p | 720p는 별도의 고출력 VRAM 엔드포인트를 사용합니다. |
| aspect_ratio | enum | landscape | landscape, portrait | MOSS는 가로(16:9)와 세로(9:16)만 지원합니다. |
| duration | number | 8 | 2 ~ 8 | 클립 길이는 초 단위로 측정됩니다. 업스트림 모델은 8초로 제한되어 있습니다. |
| t2v_quality | enum | quality | fast, quality | 텍스트-비디오 전용. Fast는 충실도를 대가로 ~2× 속도를 내줍니다. |
| num_inference_steps | number | 25 | 10 ~ 50 | 확산 단계. More = 더 높은 충실도, 느림. |
| cfg_scale | number | 5 | 1 ~ 10 | 분류기 없는 안내. 더 높은 = 프롬프트를 더 엄격하게 따르는 것. |
| sigma_shift | number | 5 | 1 ~ 10 | 일정 변경. 해상도=360p 때만 유효합니다. |
| image | string | - | - | i2v 모드에 대한 참고 이미지 URL. |
| negative_prompt | string | - | - | 피해야 할 것들. |
| seed | number | - | - | 재현성 시드. |
32B 매개변수 MoE와 동기화된 립싱크 비디오 + 오디오를 단일 추론으로 제공합니다. 제약 조건 - 생성에 20+분이 걸릴 수 있음 - 이미지-비디오 변환은 일반적으로 text-to-video보다 더 우수한 결과를 제공합니다 - 지원되는 이미지는 1장(첫 프레임으로 사용됨) - 비디오 입력은 지원되지 않음 이미지 포맷 - jpg, jpeg, png, webp, heic, heif, bmp, tiff, tif, gif
EmpirioLabs에서 MOSS Video and Audio은(는) 종량제로 청구됩니다: 360p 비디오 $0.17 영상에 따라; 720p 비디오 $2.82 영상에 따라; T2V 패스트 $0.065 추가 요금. 이 페이지의 실시간 요금표는 항상 API 청구 금액과 일치합니다.
MOSS Video and Audio은(는) api.empiriolabs.ai의 POST /v1/videos/generations를 통해 제공되며 표준 Bearer 토큰 인증을 사용합니다.
네. EmpirioLabs 플레이그라운드에서 API와 동일한 파라미터로 MOSS Video and Audio을(를) 브라우저에서 실행하므로 코드를 작성하기 전에 프롬프트를 테스트할 수 있습니다.
EmpirioLabs 계정을 만든 다음 대시보드의 API Keys에서 키를 생성하세요. 요금은 종량제 크레딧이라 실행한 요청에 대해서만 결제합니다.