
Text-to-video and image-to-video 와 동기화된 네이티브 오디오, 720p 또는 1080p 에 3 받는 사람 15 초, 종횡비와 신속한 제어.
사용한 것만큼만 결제하세요. 구독 잠금 해제도 없습니다.
가격 카탈로그
EmpirioLabs의 가격은 모델과 단위별로 다릅니다: 토큰, 이미지, 오디오 또는 비디오 초 단위, 메시지, 3D 자산, 검색 요청 등. 인터랙티브 가격 표는 현재 카탈로그를 불러오지만, 이 대표적인 요리는 클라이언트 자바스크립트 없이도 읽을 수 있습니다.
이미지당 입력 $0.05. 비디오 출력은 480p에서 초당 $0.096, 720p에서는 초당 $0.168 속도로 시작합니다.
비용 효율적인 장기 문맥 멀티모달 API의 입력은 100만 개의 프롬프트 토큰당 $0.40개부터 시작합니다.
입력은 멀티모달 추론, 코딩, 에이전트 작업을 위한 100만 프롬프트 토큰당 $0.30개부터 시작합니다.
이미지에서 3D로의 생성은 생성된 3D 자산당 요금이 책정되며, 포맷과 해상도 조절에 관한 문서가 제공됩니다.
모델 API 요금은 USD로 표시되고 청구됩니다. 대상인 경우 체크아웃에서 현지 결제 수단이 표시될 수 있습니다.

Text-to-video and image-to-video 와 동기화된 네이티브 오디오, 720p 또는 1080p 에 3 받는 사람 15 초, 종횡비와 신속한 제어.

Reasoning 및 코딩 모델 1M 토큰 컨텍스트, 128K 출력, 조정 가능한 이유 노력, 기본 웹 검색 및 도구 호출.

Kimi K3 is Moonshot's flagship reasoning model with a 1M token context, always-on thinking, native web search, and text, image, and video inputs.

김이 K2.7 Code is Moonshot's 조 모수 Agentic coding model with 256K context, always-on reasoning, and text, image, and video input.
김이 K2.7 Code is Moonshot's 조 모수 Agentic coding model with 256K context, always-on reasoning, and text, image, and video input.

100만 토큰 맥락, 이미지 및 비디오 이해, 인용 출처가 포함된 내장 웹 검색, 도구 호출 기능을 갖춘 메타 프런티어 추론 모델입니다.

Updated multi-agent conductor for hard reasoning, coding, and research, with distinct max effort, 1M context, image input, and web search.

텍스트, 이미지, 비디오, 코딩, 도구 사용, GUI 이해 및 1M-context 워크플로우에 대한 비용 효율적인 Qwen3.7 비전 언어 모델.
텍스트, 이미지, 비디오, 코딩, 도구 사용, GUI 이해 및 1M-context 워크플로우에 대한 비용 효율적인 Qwen3.7 비전 언어 모델.

김이 K2.7 Code Highspeed는 256K 컨텍스트와 함께 Moonshot의 에이전트 코딩 모델의 더 빠른 보호 계층이며, 항상 이유 및 이미지 및 비디오 입력.

Original multi-agent conductor for hard reasoning, coding, and research, with 1M context, image input, function calling, and web search.

Fast Qwen3.7 vision-language model for text, image, video, tool use, and agentic tasks, with implicit caching and a 1M token context.
Fast Qwen3.7 vision-language model for text, image, video, tool use, and agentic tasks, with implicit caching and a 1M token context.
MiniMax M3는 텍스트, 이미지 및 비디오 입력을 사용하여 코딩, 에이전트 및 긴 텍스트 분석을위한 멀티 모달 이유 모델입니다.
MiniMax M3는 텍스트, 이미지 및 비디오 입력을 사용하여 코딩, 에이전트 및 긴 텍스트 분석을위한 멀티 모달 이유 모델입니다.

스카이프 8.49.0.49 Max는 코딩, 생산성, 긴 실행 에이전트, 깊은 생각, 도구 및 1M-token 컨텍스트에 대한 주력 텍스트 모델입니다.
스카이프 8.49.0.49 Max는 코딩, 생산성, 긴 실행 에이전트, 깊은 생각, 도구 및 1M-token 컨텍스트에 대한 주력 텍스트 모델입니다.
text-to-song 및 lyric-guided 오디오에 대한 오픈 소스 음악 생성 모델, 제어 가능한 노래를 위한 빠른 8단계 XL Turbo inference와 함께.
아파치 라이선스 4B FLUX.2 Klein 이미지 생성 및 편집 모델 text-to-image, 참고 이미지 편집 및 크리에이티브 워크플로우 지원.
높은 속도 M2.7 변형은 강한 대리인 기능을 가진 강한 다목적 성과로 빠른 inference를 위해 조정했습니다.
실시간 음성 모델로 평범한 영어 음성 지시, 100+ 개 언어 간 단일 음성 식별, 200ms 미만의 스트리밍 time-to-first-audio.
Sub-130ms TTFB 음성 합성 15개국어 271개 이상의 음성, 고속 프로세싱, 실시간 SSE 스트리밍, 저속 음성 에이전트.
15개 언어의 271개 이상의 음성, 271개 이상의 음성, 실시간 SSE 스트리밍, per-word 타임스탬프와 함께 방송 품질의 음성 합성.
202K 컨텍스트, 128K 출력, 도구 호출, 구조 출력 및 캐시 지원이있는 Long-context Zhipu AI reasoning 모델.
Kimi K2.6는 256K 컨텍스트, 강력한 코딩 및 텍스트, 이미지 및 비디오 입력을 가진 Moonshot 멀티모드의 이유 모델입니다.
MiniMax M2.7은 간헐적인 사고, 함수 호출, 그리고 신속한 캐싱과 함께 범용적인 대칭 채팅 모델입니다.
TRELLIS.2 이미지-to-3D 모델은 해상도, 종자, 메쉬, 질감, 수출 컨트롤을 가진 텍스처 GLB 자산으로 참조 이미지를 전환합니다.
Qwen3.5 122B-A10B는 256K 컨텍스트, 효율적인 sparse MoE inference 및 텍스트, 이미지 및 비디오 입력을 가진 다소 이유 모델입니다.
Qwen3.5 397B-A17B는 언어, 코드, 에이전트, GUI 작업 및 이미지 및 비디오 이해에 대한 주력 멀티모드 소싱 모델입니다.
Qwen3.5 35B-A3B는 sparse MoE routing, 깊은 생각 및 텍스트, 이미지 및 비디오 입력과 효율적인 네이티브 비전 언어 모델입니다.
Qwen3.5 27B는 빠른 응답, 256K 컨텍스트 및 텍스트, 이미지 및 비디오 이해를 가진 dense 다modal reasoning 모형입니다.
Qwen3.6 27B는 에이전트 코딩, STEM 소싱, 공간 비전, OCR 및 텍스트, 이미지 및 256K 컨텍스트에 대한 비디오 이해를 향상시킵니다.

빠른 Qwen3.6 에이전트 코딩, 수학 소싱, 공간 이해, OCR 및 텍스트, 이미지 및 비디오 입력을위한 비전 언어 모델.
빠른 Qwen3.6 에이전트 코딩, 수학 소싱, 공간 이해, OCR 및 텍스트, 이미지 및 비디오 입력을위한 비전 언어 모델.
Gemma 4 26B A4B는 256K 컨텍스트, 텍스트, 이미지 및 비디오 입력, 도구 및 구조화 된 출력이있는 Google 오픈 멀티 모드 모델입니다.
Qwen3.5 9B는 256K 컨텍스트, 이미지 및 비디오 입력, 기능 도구 및 구조화된 출력을 가진 조밀한 다중화 reasoning 모형입니다.

Qwen3.5 4B는 256K 컨텍스트, 이미지 및 비디오 입력, 기능 도구 및 구조화 된 출력을 가진 저비용 멀티모드 소싱 모델입니다.
Qwen3.6 35B A3B is a 256-expert mixture-of-experts reasoning model with 128K context, function tools, and strict structured JSON output.

무료 경량 GLM-4.7 텍스트 모델 코딩, reasoning, long-context 작성 및 일반 채팅.

무료 경량 GLM-4.5 텍스트 모델, 코딩, 장거리 채팅 및 일반 언어 작업.

이미지, 비디오, 파일 및 네이티브 함수 호출에 대한 무료 멀티 모달 GLM-4.6V 모델.

이미지 생성 및 편집 모델 생성 및 텍스트 또는 이미지 입력에서 이미지를 수정, inpainting, virtual try-on, style controls.

비디오 생성 모델은 텍스트 및 옵션 이미지에서 최대 2 분의 멀티 샷 비디오를 생산하여 품질을 개선하고 일관성을 보장합니다.

Nova-3 모델과 다국어 지원 및 생산 작업 부하에 대한 고급 사용자 정의 설정을 사용하여 Speech-to-text transcription.

Pairs DeepSeek R1 chain-of-thought 는 Anthropic Claude 크리에이티브와 코딩되지 않은 인터페이스 뒤에 코드 생성을 주장합니다.

오픈 소스 LLM은 Lean 4의 공식적인 이론을 전문으로 하고 있으며, 반복적인 이론을 개발합니다.

Open-source Mixture-of-Experts LLM은 긴 형식의 프롬프트를 통해 높은 효율, 코딩 및 일반 언어 작업을 위해 조정되었습니다.

284B 총 / 13B 활성 매개 변수와 네이티브 1M 컨텍스트가 장착 된 경량 MoE 모델, 비용 효율적인 높은 통화 사용.

284B 총 / 13B 활성 매개 변수와 네이티브 1M 컨텍스트가 장착 된 경량 MoE 모델, 비용 효율적인 높은 통화 사용.
284B 총 / 13B 활성 매개 변수와 네이티브 1M 컨텍스트가 장착 된 경량 MoE 모델, 비용 효율적인 높은 통화 사용.
1.6T 합계/49B 활동적인 모수를 가진 Flagship MoE LLM 및 진보된 수학, 논리적인 주입 및 전문화한 기호화를 위한 본래 1M 컨텍스트.

1.6T 합계/49B 활동적인 모수를 가진 Flagship MoE LLM 및 진보된 수학, 논리적인 주입 및 전문화한 기호화를 위한 본래 1M 컨텍스트.
1.6T 합계/49B 활동적인 모수를 가진 Flagship MoE LLM 및 진보된 수학, 논리적인 주입 및 전문화한 기호화를 위한 본래 1M 컨텍스트.

퀵 LLM 스타일은 신선한 Exa 웹 검색 결과 inline 인용 및 소스 링크에 기반을 둔 자연 언어 질문에 대한 답변을 제공합니다.

페이지를 찾는 웹 검색 엔진, 비슷한 페이지를 검색, 크롤링, 및 AI 에이전트를위한 열린 웹에서 전용 코드 검색.

단일 및 멀티 스피커 음성 및 제어 가능한 스타일, 악센트 및 표현식 톤을 가진 낮은 속도 text-to-speech.

podcasts, audiobooks 및 고객 지원을위한 고품질 TTS 미리보기, 23 + 언어의 표현식 멀티 스피커와 함께.

narration, 조수 및 음성 앱을 통해 정밀한 스타일, 음색, 속도 및 납품을 위한 새로운 오디오 태그를 가진 높게 지배할 수 있는 TTS.

Open-source vision-language model with 128K context, 140+ languages, 개량 math/reasoning, 구조 출력 및 함수 호출.

LLM 기반 text-to-speech 오디오 및 감정 압축의 3-10s에서 제로 샷 음성 복제, 다중 반복 RL을 통해 제어 가능한 출력.

AI versus Human, classifying content as totally human, AI, mix.

Text-to-Video, Image-to-Video, Reference-to-Video 및 Video Edit 모드를 제공하는 비디오 모델은 높은-fidelity, Motion-smooth 출력을 제공합니다.

오픈 소스 text-to-image 모델은 photorealistic 디테일과 강력한 다국어 텍스트 렌더링을 갖춘 멀티모탈 믹스필드의 전문가 아키텍처입니다.
8.3B-parameter 비디오 모델 기본 720p 출력 (1080p로 확장 가능), 강력한 모션 일관성 및 이중 언어 신속한 10s까지 이해.

Janus Pro 7B 모델의 Autoregressive Framework는 하나의 아키텍처에서 다중 이해와 이미지 생성을 통합합니다.

Text-to-Video, Image-to-Video, Reference-to-Video, Edit, native sound, multi-scene transition로 표준 또는 Pro 모드에서 비디오 모델.

표준 720p 및 Pro 1080p 계층과 참조 이미지의 문자에 참조 비디오에서 모션을 전송하는 Kling 3.0 모델.

초기 결과가 충분할 때 쿼리를 유지하는 Iterative AI 검색은 표준 모드보다 더 포괄적 인 답변을 반환합니다.

상세 개요 및 답변으로 AI-powered 웹 검색, Deep Search보다 빠른. OpenAI SimpleQA 벤치 마크에 # 1 순위.

비용 효율적인 언어 모델 경쟁력 있는 대기 시간에 일반 생산 작업 부하에 대 한 강한 이유와 멀티 모드 성능을 제공.

강력한 reasoning, 코딩 및 STEM 성능을 갖춘 엔터프라이즈 급 모델, 하이브리드, 온-프레임 및 인-VPC 배포 지원.

이미지 분석, 프로그래밍, 수학 및 다국어 작업을 위한 128K 컨텍스트를 갖춘 24B-parameter 멀티모드 모델

하이브리드 모델 불화 Instruct, Reasoning (Magistral) 및 Devstral 가족: 40 % 낮은 완료 시간 및 3x throughput 대 소형 3.

Open-source 32B MoE 기초 모델은 정밀한 듀얼-투워 립 동기화를 가진 원스톱 단계에서 동기화된 비디오 및 오디오를 생성합니다.

300K 컨텍스트에 텍스트, 이미지 및 비디오에 대한 저비용 멀티모드 기반 모델 (최대 30 분 비디오), 속도 및 감당성을 위해 조정.

텍스트, 이미지, 문서 및 1M 컨텍스트에 비디오에 대한 빠르고 비용 효율적인 멀티모드 감응작용 모델 (긴 문서 및 ~90 분 클립).

텍스트 전용 기반 모델은 128K 컨텍스트에서 초저 대기 시간 및 비용을 조정했습니다. 요약, 번역 및 채팅에 강한 44% 캐시 할인.

가족에서 가장 가능한 모델. Multimodal text/image /video on the 1M context with chain-of-thought reasoning throughout tools and data source.

Multimodal 기초 모형 균형을 잡는 정확도, 속도, 및 원본, 이미지 및 300K 상황에 영상을 위한 비용 (최대 ~30 분 영상).

Whisper-1 speech-to-text transcription은 다중 언어 감독 오디오에 훈련되었으며 파일당 25 MB 업로드 제한이 있습니다.

Claude Opus 4.6 reasoning에 의해 구동되는 Institutional 급료 연구, 최대 깊이와 더불어, 강화된 공구 접근 및 광대한 근원 적용.

다중 단계 retrieval, 종합 및 reasoning, autonomously searching, reading, and evaluating source에 대한 연구 모델은 복잡한 주제를 통해.

Sonar Pro as a agentic researcher: chains web searches, fetches full pages, and streams live reasoning, 복잡한 쿼리에 대한 적응 전략.

도메인, 언어, 날짜 및 기타 필터링으로 실시간 웹 검색. 검색 결과, LLM 응답이 아닌; 파일 업로드.

up-to-date AI 검색 통합을 위한 정확한 인용 및 사용자 정의 소스로 실시간 웹 연결 검색.

두 배 인용 및 더 큰 컨텍스트 창을 가진 Search-grounded 모형은, 심도, nuanced 대답을 필요로 하는 복잡한 쿼리를 위해 조정했습니다.

웹 검색을 가진 무수한 오픈 소스 R1-1776에 모델, SimpleQA 벤치 마크에 최고의 검색 엔진 및 LLMs를 개요.

Text-to-Video, Image-to-Video 및 Transition 모드에서 영화 영상 생성

텍스트 또는 1-2 프레임 이미지에서 비디오를 생성하면 최대 1080p, 여러 측면 비율, 5-10s 지속 가능성, 옵션 동기화 오디오.
class-leading complex Chinese/English 텍스트 렌더링, 현실적인 질감 및 멀티 이미지 융합을 갖춘 통합 이미지 생성 및 편집 모델.
하이브리드 선형 유지와 비소 MoE, 1M 컨텍스트, 빠른 멀티 모달 text/image /video inference를 가진 시각 언어 모형.
하이브리드 선형 유지와 비소 MoE, 1M 컨텍스트, 빠른 멀티 모달 text/image /video inference를 가진 시각 언어 모형.

비용 효율적인 omni-modal 모델 처리 텍스트, 이미지, 오디오 및 비디오, 최대 3 시간의 오디오 및 1 시간의 비디오 90 + 언어.

텍스트, 이미지, 오디오 및 비디오를위한 Flagship omni-modal 모델. 3h 오디오, 1h 비디오, 90 + 입력 및 30 + 출력 언어, 55 음성 timbres.
1M 컨텍스트에서 텍스트, 이미지 및 비디오에 대한 효율적인 깊은 생각과 시각적 이해를위한 하이브리드 아키텍처를 갖춘 멀티 모달 모델.
1M 컨텍스트에서 텍스트, 이미지 및 비디오에 대한 효율적인 깊은 생각과 시각적 이해를위한 하이브리드 아키텍처를 갖춘 멀티 모달 모델.

3.6 시리즈 (텍스트 전용)의 가장 큰 미리보기 변형: 향상된 코딩 에이전트 실행, 강력한 프론트 엔드 기술 및 더 넓은 긴 꼬리 지식.

3.5 이상의 주요 업그레이드가있는 Vision-language 모델: 에이전트 및 프런트 엔드 코딩, 다중 상태 인식, OCR 및 객체 로컬라이제이션.
3.5 이상의 주요 업그레이드가있는 Vision-language 모델: 에이전트 및 프런트 엔드 코딩, 다중 상태 인식, OCR 및 객체 로컬라이제이션.
256K-context flagship with major improves in reasoning, 다음, 다국어 지원, 더 높은 coding/math 정확도.
중국 영어 이해, 복잡한 지침, 다국어 능력 및 도구 사용에 2.5 시리즈 이상의 주요 이득을 가진 미리보기 릴리스.
적응 도구 사용 (검색, 메모리, 코드 해석기) 및 복잡한 작업에 더 높은 정확도에 대한 테스트 시간 스케일링과 모델.

Semantic 문서 reranker. relevance에 의해 쿼리 당 최대 500 명의 후보자를 정렬하고 100 개 이상의 언어를 지원하며 사용자 정의 정렬 명령을받습니다.

Coding-tuned 256K-context model with strong front-end results and multilingual 프로그래밍 지원 for AI 코딩 도구 및 에이전트.

고주파 엔터프라이즈 워크로드의 범용 모델: 정보 처리, 콘텐츠, 검색 및 데이터 분석.

256K 컨텍스트, 4개의 소싱 노력 모드, 그리고 image/video 높은 통화 사용을 위한 이해를 가진 장시간 초점이 있는 다modal 모형.

복잡한 사고, 다소 이해, 구조화, 공구 증강 실행을 위한 256K 컨텍스트를 가진 Flagship 일반적인 모형.

기본 오디오 동기화, 카메라 제어 및 렌더링 당 낮은 비용으로 안정적인 모션과 영화 클립의 속도 최적화 2.0 비디오 변형.

영화 출력을 위한 Multimodal 영상 모형 원본, 이미지, 오디오, 또는 영상 입력에서, 안정되어 있는 동의 및 일관된 특성과 더불어.

렌더링하기 전에 프롬프트를 통해 원인을 인식하고 고해상도 및 일관성있는 편집 및 브랜드의 시각을 생산하는 통합 멀티 모드 이미지 모델.

상세한 text-to-image, 단일 이미지 편집, 다중 참조 융합을 위한 프리미엄 Seedream 이미지 모델, 1K 및 2K 출력을 지원합니다.

긴 형식을 위한 오픈 소스 음성 모델, 다 스피커 팟 캐스트 대화 with paralinguistic control (웃음, sighs) 및 Zero-shot 음성 복제.

텍스트 프롬프트에서 최대 3 분의 오디오를 생성, text-to-audio 및 audio-to-audio 조정 가능한 기간, 단계 및 CFG 스케일을 지원.

text-to-audio, audio-to-audio 및 음악 제작, 사운드 디자인 및 리믹싱을 위한 오디오 인페인팅을 가진 텍스트의 Up to-3-minute 오디오.

Stable Video Infinity 2.0 Pro on WAN 2.2: 일관성있는 문자 ID를 유지하면서 이론적으로 무한 길이 비디오로 이미지를 확장합니다.

Multi-search 연구 조수는 주제를 탐구하고, 소스를 분석하고, 인용을 가진 상세한 연구 보고서를 일으킵니다.

웹 검색 크롤링, 추출, 그리고 빠른 URL 매핑, downstream 파이프라인 페이지와 도메인에 걸쳐 구조화 된 검색.

선택할 수 있는 산출 차원 (64–2048)로 끼워넣는 다 언어 원본. 입력 당 최대 8,192 토큰.

Speed-optimised multimodal embedding - Vision-Plus와 동일한 모양, 3× 싼 image/video 토큰.

Multimodal embedding 텍스트, 이미지 및 비디오 입력을위한 독립적 인 벡터를 생산합니다.
영화용 멀티모드 비디오 생성 모델, 멀티모드 스토리 (lip-sync, 대화, 음악, SFX).

T2V, I2V, 비디오 편집 및 reference-to-video 를 지원하는 멀티모드 비디오 모델, 텍스트, 이미지 또는 비디오 입력에서 높은-fidelity 출력.

이미지 생성 및 편집 동반자 모델: text-to-image, 경계 상자 편집 및 공동 이미지 세트, 최대 4K 출력 Pro.
다국어 ASR, 번역, VAD, 타임스탬프, 자막, 핫워드, 디코더 컨트롤을 포함한 제어된 Whisper Large v3 터보 전사.

높은 수준의 프롬프트를 subtasks, 호출 도구 및 API로 전환하고, 수동 오케스트라 없이 end-to-end 결과를 제공합니다.

이미지 - 비디오 모델은 7 종횡비를 통해 480p 또는 720p에서 최대 15 초까지 프롬프트 가이드 모션으로 소스 이미지를 구현합니다.

에이전트 워크플로우, 복잡한 소프트웨어 엔지니어링, 긴호주 작업에 대한 최고 수준의 모델, 1M 컨텍스트에서 1000+ 툴 호출에 걸쳐 지속적인 작업.

1M 컨텍스트에 대한 기본 시각 및 오디오 이해를 가진 Multimodal 모델은 에이전트 워크플로우에서 modalities를 이해하고 행동하도록 설계되었습니다.

텍스트, 이미지, reference-to-video 하나의 모델에 담겨 있습니다. 시네마틱 모션, 최대 9개의 참조에 걸친 캐릭터 일관성, 그리고 동기화된 네이티브 오디오.

가장 빠르고 저렴한 Seedance 2.0 등급으로, 480p 및 720p 해상도의 네이티브 오디오, 카메라 제어, 이미지 또는 비디오 입력이 가능한 짧은 시네마틱 클립을 지원합니다.

StepFun은 이미지 및 비디오 입력, 도구 호출, 조정 가능한 추론 노력, 그리고 256K 컨텍스트를 갖춘 다중 모달 추론 모델입니다.

StepFun은 에이전트, 코딩, 툴 호출, 장기 맥락 분석을 위한 텍스트 추론 모델입니다.

에이전트 최적화 Step 3.5 플래시 변형은 추론 노력 모드와 추론 노력 모드가 모두 가능합니다.

StepFun 오디오 및 텍스트 대화 모델, 텍스트 출력과 준언어적 이해를 지원합니다.

StepFun은 text-to-image 및 단일 이미지 편집을 위한 이미지 생성 및 이미지 편집 모델입니다.

맥락 기반 StepFun text-to-speech 자연어 음성 지시와 표현력 전달을 갖춘 모델입니다.

StepFun text-to-speech 공식 음성, 맞춤형 복제 음성, 음성 태그 컨트롤이 포함된 모델입니다.

StepFun은 중국어 및 영어 오디오 전사를 위한 스트리밍 음성 인식 모델입니다.

Next-generation coding and agent model with engineering-grade code delivery, long-horizon autonomy, and 256K multimodal understanding.

Tiered speech synthesis with over 1,000 voices, 16 languages, 20 Chinese dialects, natural-language delivery direction, and inline emotion tags.
127 / 141 모델