
100만 토큰 컨텍스트를 가진 코딩 및 에이전트 모델, 128K 출력, 항상 켜져 있는 추론, 낮은 노력, 높은 노력, 최대 노력 모두에서의 추론, 네이티브 웹 검색, 툴 호출.
사용량을 통해 지불하거나, 주간 수당이 있는 플랜을 선택하세요.
가격 카탈로그
EmpirioLabs의 가격은 모델과 단위별로 다릅니다: 토큰, 이미지, 오디오 또는 비디오 초 단위, 메시지, 3D 자산, 검색 요청 등. 인터랙티브 가격 표는 현재 카탈로그를 불러오지만, 이 대표적인 요리는 클라이언트 자바스크립트 없이도 읽을 수 있습니다.
이미지당 입력 $0.05. 비디오 출력은 480p에서 초당 $0.096, 720p에서는 초당 $0.168 속도로 시작합니다.
비용 효율적인 장기 문맥 멀티모달 API의 입력은 100만 개의 프롬프트 토큰당 $0.40개부터 시작합니다.
입력은 멀티모달 추론, 코딩, 에이전트 작업을 위한 100만 프롬프트 토큰당 $0.30개부터 시작합니다.
이미지에서 3D로의 생성은 생성된 3D 자산당 요금이 책정되며, 포맷과 해상도 조절에 관한 문서가 제공됩니다.
모델 API 요금은 USD로 표시되고 청구됩니다. 대상인 경우 체크아웃에서 현지 결제 수단이 표시될 수 있습니다.
Weekly allowances across models, media, search and tasks, on top of pay as you go. Usage inside your allowances is included and never touches your credit balance.
3 of these are free to run, so they never draw from your allowance.
DeepSeek V4.1 Flash
GLM 5.3 Flash
Qwen3.8 Flash
Qwen3.8 27B
Muse Glimmer 30B
DeepSeek V4 Flash 0731
Qwen3.7 Flash
Qwen3.7 Flash (Variant 1)
미니맥스 M3
MiniMax M3 (Priority)
Step 3.7 Flash
DeepSeek V4 Flash (Variant 2)
DeepSeek V4 Flash
DeepSeek V4 Flash (Variant 1)
Qwen3.6 Flash
Qwen3.6 Flash (Variant 1)
Qwen3.6 35B A3B
Step 3.5 Flash 2603
Gemma 4 26B-A4B
MiniMax M2.7 Highspeed
MiniMax M2.7
Mistral Small 4
Qwen3.5 4B
Qwen3.5 122B-A10B
Qwen3.5 35B-A3B
Qwen3.5 27B
Qwen3.5 Flash (Variant 1)
Qwen3.5 Flash
Qwen3.5 9B
Qwen3.5 397B-A17B
Seed 2.0 Mini
Step 3.5 Flash
GLM 4.7 Flash무료This model is free to run, so using it never draws from your weekly allowance.
GLM 4.6V Flash무료This model is free to run, so using it never draws from your weekly allowance.
GLM 4.5 Flash무료This model is free to run, so using it never draws from your weekly allowance.
Mistral Small 3.1
Gemma 3 27B
Nova Lite 1.0
Nova Micro 1.0
Fugu Max
Fugu Ultra v2.0
Qwen3.8 Max 0902
Muse Spark 1.3
GLM 5.3
DeepSeek V4 Pro 0813
Muse Spark 1.2
Qwen3.8 Max
Qwen3.8 Max (Variant 1)
Fugu Ultra v1.1
Kimi K3
Seed 2.1 Turbo
Muse Spark 1.1
Fugu Ultra v1.0
Kimi K2.7 Code
GLM 5.2
Kimi K2.7 Code Highspeed
GLM 5.2 (Variant 1)
Kimi K2.7 Code (Variant 1)
Qwen3.7 플러스
Qwen3.7 Plus (Variant 1)
Qwen3.7 Max
Qwen3.7 Max (Variant 1)
MiMo V2.5 Pro
DeepSeek V4 Pro (Variant 2)
DeepSeek V4 Pro
DeepSeek V4 Pro (Variant 1)
Qwen3.6 27B
MiMo V2.5
Kimi K2.6
Qwen3.6 Max Preview
GLM 5.1
Qwen3.6 Plus (Variant 1)
Qwen3.6 Plus
Qwen3.5 Omni Flash
Qwen3.5 Omni Plus
Qwen3.5 Plus (Variant 1)
Qwen3.5 Plus
Seed 2.0 Code
Seed 2.0 Lite
Seed 2.0 Pro
Nova Lite 2
DeepSeek V3.2
Qwen3 Max
Qwen3 Max Thinking
Qwen3 Max Preview
DeepReasoning
Nova Pro 1.0
Perplexity Sonar
StepAudio 2.5 ChatAllowances cover models, media, search and tasks, including generation templates and Compose. Past them, usage bills at normal pay-as-you-go rates. Personal use only, no reselling. Allowances refresh weekly and do not roll over.

100만 토큰 컨텍스트를 가진 코딩 및 에이전트 모델, 128K 출력, 항상 켜져 있는 추론, 낮은 노력, 높은 노력, 최대 노력 모두에서의 추론, 네이티브 웹 검색, 툴 호출.

텍스트-비디오 및 image-to-video 동기화된 네이티브 오디오가 적용되며, 720p 또는 1080p로 3초에서 15초까지 재생되며, 화면비와 프롬프트 컨트롤이 가능합니다.

1M 토큰 컨텍스트, 이미지 및 비디오 입력, 항상 연결된 추론, 네이티브 웹 검색, 툴 호출을 지원하는 네이티브 멀티모달 플래시 모델입니다.

100만 토큰 컨텍스트, 128K 출력, 조정 가능한 추론 노력, 네이티브 웹 검색, 툴 호출 기능을 갖춘 추론 및 코딩 모델.
100만 토큰 컨텍스트, 128K 출력, 조정 가능한 추론 노력, 네이티브 웹 검색, 툴 호출 기능을 갖춘 추론 및 코딩 모델.

Kimi K3는 1M 토큰 컨텍스트, 항상 연결된 사고, 네이티브 웹 검색, 텍스트, 이미지, 비디오 입력을 갖춘 Moonshot의 대표 추론 모델입니다.

Meta의 업데이트된 프런티어 추론 모델은 1,048,576개의 토큰 컨텍스트, 이미지, 비디오, 오디오, PDF 이해, 웹 검색, 툴 호출을 포함합니다.

Kimi K2.7 코드는 문샷의 수조 매개변수 에이전트틱 코딩 모델로, 256K 맥락, 항상 연결된 추론, 텍스트, 이미지, 비디오 입력을 지원합니다.
Kimi K2.7 코드는 문샷의 수조 매개변수 에이전트틱 코딩 모델로, 256K 맥락, 항상 연결된 추론, 텍스트, 이미지, 비디오 입력을 지원합니다.

1,048,576개의 토큰 맥락과 이미지, 비디오, 오디오, PDF 이해, 웹 검색, 도구 호출을 포함한 메타 프런티어 추론 모델입니다.

하드 추론, 코딩, 연구를 위한 업데이트된 다중 에이전트 컨덕터로, 최대 노력, 1M 맥락, 이미지 입력, 웹 검색 기능을 지원합니다.

텍스트, 이미지, 비디오, 코딩, 도구 사용, GUI 이해, 100만 컨텍스트 워크플로우를 위한 비용 효율적인 Qwen3.7 비전 언어 모델입니다.
텍스트, 이미지, 비디오, 코딩, 도구 사용, GUI 이해, 100만 컨텍스트 워크플로우를 위한 비용 효율적인 Qwen3.7 비전 언어 모델입니다.

Kimi K2.7 Code Highspeed는 Moonshot의 에이전트 코딩 모델 중 더 빠른 서빙 계층으로, 256K 컨텍스트, 항상 연결된 추론, 이미지 및 비디오 입력을 지원합니다.

하드 추론, 코딩, 연구를 위한 원조 다중 에이전트 컨덕터로, 1M 컨텍스트, 이미지 입력, 함수 호출, 웹 검색 기능을 지원합니다.

텍스트, 이미지, 비디오, 도구 사용 및 에이전트 작업을 위한 빠른 Qwen3.7 시각 언어 모델로, 암묵적 캐싱과 1M 토큰 컨텍스트를 지원합니다.
텍스트, 이미지, 비디오, 도구 사용 및 에이전트 작업을 위한 빠른 Qwen3.7 시각 언어 모델로, 암묵적 캐싱과 1M 토큰 컨텍스트를 지원합니다.
MiniMax M3는 텍스트, 이미지, 비디오 입력을 포함한 코딩, 에이전트, 장기 맥락 분석을 위한 다중 모달 추론 모델입니다.
MiniMax M3는 텍스트, 이미지, 비디오 입력을 포함한 코딩, 에이전트, 장기 맥락 분석을 위한 다중 모달 추론 모델입니다.

Qwen3.7 Max는 코딩, 생산성, 장기 실행 에이전트, 심층 사고, 도구, 그리고 1M 토큰 컨텍스트를 위한 대표적인 텍스트 모델입니다.
Qwen3.7 Max는 코딩, 생산성, 장기 실행 에이전트, 심층 사고, 도구, 그리고 1M 토큰 컨텍스트를 위한 대표적인 텍스트 모델입니다.

조 규모의 MoE 대표 모델로, 코딩, 장기 대개 에이전트, 전문 업무를 위한 모델로, 100만 토큰 맥락에서 이미지와 비디오 이해를 지원합니다.
조 규모의 MoE 대표 모델로, 코딩, 장기 대개 에이전트, 전문 업무를 위한 모델로, 100만 토큰 맥락에서 이미지와 비디오 이해를 지원합니다.

빠른 Qwen3.8 시각 언어 모델로, 코딩, 에이전트, 시각적 이해를 위한 이미지와 비디오 입력, 다섯 개의 내장 도구, 1M 토큰 컨텍스트를 지원합니다.

업그레이드된 Qwen3.8 Max 스냅샷으로, 더 강력한 코딩, 더 안정적인 멀티툴 에이전트 실행, 그리고 100만 토큰 컨텍스트에서 더 선명한 차트 및 문서 비전을 제공합니다.
text-to-song 및 가사 유도 오디오를 위한 오픈 소스 음악 생성 모델과 빠른 8단계 XL 터보 추론을 통해 노래 반복을 제어할 수 있습니다.
아파치 라이선스 4B FLUX.2 Klein 이미지 생성 및 편집 모델로, text-to-image, 참조 이미지 편집, 창의적인 워크플로우 지원이 가능합니다.
고속 M2.7 변형으로, 강력한 범용 성능과 강력한 에이전트 능력을 갖춘 고속 추론을 위해 조정되었습니다.
실시간 음성 모델은 평범한 영어 전달 방향을 따르고, 200+ 언어에 걸쳐 하나의 음성 정체성을 유지하며, 단어 타임스탬프와 함께 스트리밍합니다.
15개 언어에서 271+ 음성 처리를 지원하는 130ms 미만의 TTFB 음성 합성, 표현력 있는 운율, 그리고 저지연 음성 에이전트를 위한 실시간 SSE 스트리밍.
풍부한 표현력 있는 운율을 가진 방송 품질의 음성 합성, 15개 언어에 걸친 271+ 음성 지원, 그리고 단어당 타임스탬프가 포함된 실시간 SSE 스트리밍.
202K 컨텍스트, 128K 출력, 툴 호출, 구조화된 출력, 캐시 지원을 갖춘 롱 컨텍스트 Zhipu AI 추론 모델입니다.
Kimi K2.6은 256K 맥락, 강력한 코딩, 텍스트, 이미지, 비디오 입력을 갖춘 Moonshot 멀티모달 추론 모델입니다.

코딩, 저장소 작업, 도구 사용, 풀스택 작업 전반에 걸쳐 큰 향상을 이룬 포스트 트레이닝된 0731 릴리스이며, 100만 개의 컨텍스트 창도 추가되었습니다.

코딩, 저장소 작업, 도구 사용, 풀스택 작업 전반에 걸쳐 큰 향상을 이룬 포스트 트레이닝된 0731 릴리스이며, 100만 개의 컨텍스트 창도 추가되었습니다.
가사와 스타일 프롬프트를 바탕으로 완전한 스테레오 곡을 생성하며, 최대 5분까지 지속 시간, 시드, 포맷 조절이 가능합니다.

코딩, 저장소 작업, 도구 사용, 에이전트 작업 전반에 걸쳐 큰 향상을 이루었으며, 하이브리드 사고와 100만 개의 컨텍스트 창을 갖춘 공식 0813 프로 릴리스입니다.

Meta의 장기 지평선 에이전트 추론 모델은 1,048,576개의 토큰 문맥, 이미지, 비디오, PDF 이해, 웹 검색 및 도구 호출을 포함합니다.
지연 우선 실시간 음성 합성으로, 200+ 언어에서 하나의 음성 정체성을 유지하며, 고용량 스트리밍 작업에 최적화되어 있습니다.

DeepSeek의 새로운 아키텍처의 경량 플래그십으로, 네이티브 이미지 이해, 하이브리드 사고, 100만 개의 맥락, 최대 384K 출력 토큰을 지원합니다.
MiniMax M2.7은 교차 사고, 함수 호출, 프롬프트 캐싱을 갖춘 범용 추론 채팅 모델입니다.
TRELLIS.2 이미지-3D 모델은 참조 이미지를 해상도, 시드, 메쉬, 텍스처, 내보내기 컨트롤이 있는 텍스처가 있는 GLB 자산으로 변환합니다.
Qwen3.5 122B-A10B는 256K 맥락, 효율적인 희소 MoE 추론, 텍스트, 이미지, 비디오 입력을 갖춘 다중 모달 추론 모델입니다.
Qwen3.5 397B-A17B는 언어, 코드, 에이전트, GUI 작업, 이미지 및 비디오 이해를 위한 대표적인 다중 모달 추론 모델입니다.
Qwen3.5 35B-A3B는 희소한 MoE 라우팅, 깊은 사고, 텍스트, 이미지, 비디오 입력을 갖춘 효율적인 네이티브 시각 언어 모델입니다.
Qwen3.5 27B는 빠른 응답, 256K 맥락, 텍스트, 이미지, 비디오 이해를 갖춘 밀도 높은 다중 모달 추론 모델입니다.
256K 컨텍스트, 이미지 및 비디오 입력, 함수 도구, 구조화된 JSON, 그리고 기본적으로 생각하는 기능을 갖춘 멀티모달 추론기입니다.
Qwen3.6 27B는 에이전트 코딩, STEM 추론, 공간 시각, OCR, 그리고 256K 맥락에서 텍스트, 이미지, 비디오 이해를 향상시킵니다.

Fast Qwen3.6 에이전트 코딩, 수학 추론, 공간 이해, OCR, 텍스트, 이미지, 비디오 입력을 위한 시각 언어 모델입니다.
Fast Qwen3.6 에이전트 코딩, 수학 추론, 공간 이해, OCR, 텍스트, 이미지, 비디오 입력을 위한 시각 언어 모델입니다.
Gemma 4 26B A4B는 256K 문맥, 텍스트, 이미지, 비디오 입력, 도구, 구조화된 출력을 갖춘 구글 오픈 멀티모달 모델입니다.
이미지 이해, 128K 맥락, 툴 호출, 구조화된 출력, 그리고 제어 가능한 추론 강도를 갖춘 메타 오픈 30B 에이전트 모델입니다.
Qwen3.5 9B는 256K 컨텍스트, 이미지 및 비디오 입력, 함수 도구, 구조화된 출력을 갖춘 컴팩트한 다중 모달 추론 모델입니다.

Qwen3.5 4B는 256K 맥락, 이미지 및 비디오 입력, 함수 도구, 구조화된 출력을 갖춘 저비용 다중 모달 추론 모델입니다.
Qwen3.6 35B A3B는 128K 문맥, 함수 도구, 엄격한 구조화된 JSON 출력을 가진 256명의 전문가 mixture-of-experts 추론 모델입니다.

코딩, 추론, 긴 문맥 작성, 일반 채팅을 위한 무료 경량 GLM-4.7 텍스트 모델입니다.

추론, 코딩, 장기 채팅, 일반 언어 작업을 위한 무료 경량 GLM-4.5 텍스트 모델입니다.

이미지, 비디오, 파일, 텍스트 이해를 위한 무료 멀티모달 GLM-4.6V 모델로, 네이티브 함수 호출이 가능합니다.

이미지 생성 및 편집 모델은 텍스트나 이미지 입력을 기반으로 이미지를 생성하고 수정하며, 인페인트, 가상 시험 및 스타일 제어 기능을 제공합니다.

텍스트와 선택적 이미지 프롬프트를 통해 최대 2분 분량의 다중 촬영 영상을 제작하는 비디오 생성 모델은 품질과 일관성이 향상되었습니다.

Nova-3 모델을 사용한 음성 변환 전사, 다국어 지원과 생산 작업 부하에 맞춘 고급 맞춤 설정 지원.

DeepSeek R1 chain-of-thought 추론과 Anthropic Claude의 크리에이티브 및 코드 생성을 결합한 통합 데이터 제어 인터페이스 뒤에 있습니다.

오픈 소스 Mixture-of-Experts LLM은 긴 형식 프롬프트에서 고효율 추론, 코딩 및 일반 언어 작업에 최적화되어 있습니다.

총 284B / 활성 매개변수 13B, 네이티브 1M 컨텍스트를 가진 경량 MoE 모델로, 저지연 시간과 비용 효율적인 고동시성 사용에 최적화되어 있습니다.

총 284B / 활성 매개변수 13B, 네이티브 1M 컨텍스트를 가진 경량 MoE 모델로, 저지연 시간과 비용 효율적인 고동시성 사용에 최적화되어 있습니다.
총 284B / 활성 매개변수 13B, 네이티브 1M 컨텍스트를 가진 경량 MoE 모델로, 저지연 시간과 비용 효율적인 고동시성 사용에 최적화되어 있습니다.

총 284B / 활성 매개변수 13B, 네이티브 1M 컨텍스트를 가진 경량 MoE 모델로, 저지연 시간과 비용 효율적인 고동시성 사용에 최적화되어 있습니다.
1.6T 총 / 49B 활성 매개변수와 고급 수학, 논리 추론, 특수 코딩을 위한 네이티브 1M 컨텍스트를 갖춘 대표적인 MoE LLM입니다.

1.6T 총 / 49B 활성 매개변수와 고급 수학, 논리 추론, 특수 코딩을 위한 네이티브 1M 컨텍스트를 갖춘 대표적인 MoE LLM입니다.
1.6T 총 / 49B 활성 매개변수와 고급 수학, 논리 추론, 특수 코딩을 위한 네이티브 1M 컨텍스트를 갖춘 대표적인 MoE LLM입니다.

1.6T 총 / 49B 활성 매개변수와 고급 수학, 논리 추론, 특수 코딩을 위한 네이티브 1M 컨텍스트를 갖춘 대표적인 MoE LLM입니다.

자연어 질문에 대한 빠른 LLM 스타일의 답변, 신선한 Exa 웹 검색 결과와 인라인 인용 및 출처 링크에 기반합니다.

웹 검색 엔진은 AI 에이전트를 위한 오픈 웹 전역에서 페이지 찾기, 유사 페이지 검색, 크롤링, 전용 코드 검색을 지원합니다.

단일 및 다중 스피커 음성, 제어 가능한 스타일, 억양, 표현력 있는 톤을 갖춘 저지연 text-to-speech 프로덕션 앱에 적합합니다.

팟캐스트, 오디오북, 고객 지원을 위한 고품질 TTS 미리보기와 23+ 언어 전반에 걸친 표현력 있는 다중 화자 음성.

내레이션, 어시스턴트, 음성 앱 전반에 걸쳐 정밀한 스타일, 톤, 속도, 전달을 위한 새로운 오디오 태그를 통해 매우 제어가 가능한 TTS입니다.

128K 문맥, 140+ 언어, 향상된 math/reasoning, 구조화된 출력, 함수 호출을 지원하는 오픈 소스 비전 언어 모델입니다.

LLM 기반 text-to-speech로, 3-10초 오디오에서 제로 샷 음성 복제와 다중 보상 강화 학습을 통한 감정 표현 및 제어 가능한 출력을 제공합니다.

딥러닝 감지기는 AI가 생성한 텍스트와 인간이 생성한 것으로 추정되는 부분을 표시하며, 완전히 인간, AI, 혼합 콘텐츠로 분류합니다.

텍스트-비디오, 이미지-비디오, 참조-비디오 및 비디오 편집 모드를 제공하며, 고충실도와 모션 부드럽게 출력됩니다.

다중 모달 Mixture-of-Experts 아키텍처 위의 오픈 소스 text-to-image 모델로, 사진처럼 사실적인 디테일과 강력한 다국어 텍스트 렌더링을 지원합니다.
8.3B 매개변수 비디오 모델로, 네이티브 720p 출력(1080p로 업스케일링 가능), 강한 동작 일관성, 최대 10초의 이중언어 프롬프트 이해 능력.

Janus Pro 7B 모델의 자기회귀 프레임워크는 다중 모달 이해와 이미지 생성을 하나의 아키텍처로 통합합니다.

텍스트-비디오, 이미지-비디오 변환, 참조-비디오 변환, 편집, 네이티브 사운드, 다중 장면 전환을 포함한 표준 또는 프로 모드의 비디오 모델.

Kling 3.0 모델은 레퍼런스 비디오에서 레퍼런스 이미지의 캐릭터로 모션을 전송하며, 스탠다드 720p 및 프로 1080p 티어가 있습니다.

초기 결과가 부족할 때도 계속 쿼리를 하는 반복적인 AI 검색으로, 표준 모드보다 더 포괄적인 답변을 반환합니다.

AI 기반 웹 검색, 딥 서치보다 빠른 상세한 개요와 답변을 제공합니다. OpenAI SimpleQA 벤치마크에서 #1위를 차지했습니다.

24B 매개변수 멀티모달 모델을 포함하며, 128K 맥락을 통해 이미지 분석, 프로그래밍, 수학 및 다국어 작업을 위한 효율적인 국소 추론을 위해 조정되었습니다.

Instruct, Reasoning(Magistral), Devstral 계열을 통합한 하이브리드 모델: Small 3에 비해 완료 시간이 40% 짧고 처리량이 3배 증가합니다.

정밀한 듀얼 타워 립싱크와 함께 한 추론 단계에서 동기화된 비디오와 오디오를 생성하는 오픈 소스 32B MoE 기초 모델입니다.

30만 개의 맥락에서 텍스트, 이미지, 비디오를 위한 저비용 멀티모달 기초 모델(최대 ~30분 영상)에서 속도와 경제성을 고려해 조정되었습니다.

텍스트, 이미지, 문서, 영상을 1M 맥락에서 빠르고 비용 효율적인 다중 모달 추론 모델(긴 문서와 ~90분 클립).

128K 컨텍스트에서 초저지연과 비용을 고려해 튜닝된 텍스트 전용 기초 모델. 요약, 번역, 채팅에 강력하며, 캐시 44% 할인도 제공합니다.

30만 개 컨텍스트(최대 ~30분 영상)에서 텍스트, 이미지, 비디오의 정확도, 속도, 비용 균형을 맞추는 멀티모달 기초 모델.

Whisper-1 speech-to-text 다국어 감독 오디오로 학습된 전사로, 파일당 업로드 제한 25MB가 있습니다.

Claude Opus 4.6 추론으로 구동되는 기관급 연구, 최대 깊이, 향상된 도구 접근성, 광범위한 출처 커버리지를 제공합니다.

복잡한 주제에 걸쳐 자율적으로 검색, 읽기, 평가하는 다단계 검색, 종합, 추론 연구 모델.

Sonar Pro는 에이전트 리서처럼: 웹 검색을 연쇄 처리하고, 전체 페이지를 가져오며, 실시간 추론을 스트리밍하며 복잡한 쿼리에 맞춰 전략을 조정합니다.

도메인, 언어, 날짜 등 필터링이 가능한 실시간 웹 검색. 검색 결과를 반환하며, LLM 응답이 아닙니다; 파일 업로드가 없습니다.

실시간 웹 연결 검색과 정확한 인용, 맞춤형 소스 제공, up-to-date AI 검색 통합을 위한 프로덕션 앱에서의 검색 기능.

검색 기반 모델로, 인용 횟수가 두 배이고 더 큰 맥락 창을 제공하며, 심층적이고 미묘한 답변이 필요한 복잡한 쿼리에 맞춰져 있습니다.

검열 없는 오픈 소스 R1-1776에 적용된 추론 모델은 웹 검색을 지원하며, SimpleQA 벤치마크에서 선도적인 검색 엔진과 LLM을 능가합니다.

텍스트-비디오, 이미지-비디오, 전환 모드에서 고디테일, 유연한 움직임, 생생한 애니메이션을 갖춘 시네마틱 비디오 생성.

텍스트 또는 1-2프레임 이미지 프롬프트에서 최대 1080p, 다중 화면 비율, 5-10초 재생 시간, 선택 사항으로 동기화된 오디오를 생성할 수 있습니다.

클래스 선도의 복잡한 Chinese/English 텍스트 렌더링, 사실적인 텍스처, 다중 이미지 융합을 갖춘 통합 이미지 생성 및 편집 모델입니다.

Qwen 이미지 생성 및 편집, Base 및 Pro 변형, 다국어 타이포그래피, 다중 이미지 참조, 그리고 제어 가능한 1K 또는 2K 출력.
하이브리드 선형 주의와 희소 MoE, 1M 맥락, 빠른 다중 모달 text/image/비디오 추론을 갖춘 시각 언어 모델입니다.
하이브리드 선형 주의와 희소 MoE, 1M 맥락, 빠른 다중 모달 text/image/비디오 추론을 갖춘 시각 언어 모델입니다.

텍스트, 이미지, 오디오, 비디오를 처리하는 비용 효율적인 옴니 모달 모델로, 90+ 언어에서 최대 3시간의 오디오와 1시간의 비디오를 지원합니다.

텍스트, 이미지, 오디오, 비디오를 위한 대표적인 옴니모달 모델입니다. 3시간 오디오, 1시간 비디오, 90+ 입력 및 30+ 출력 언어, 55가지 음성 음색.
텍스트, 이미지, 비디오 전반에 걸쳐 1M 맥락에서 효율적인 심층 사고와 시각적 이해를 위한 하이브리드 아키텍처의 멀티모달 모델.
텍스트, 이미지, 비디오 전반에 걸쳐 1M 맥락에서 효율적인 심층 사고와 시각적 이해를 위한 하이브리드 아키텍처의 멀티모달 모델.

3.6 시리즈(텍스트 전용 텍스트) 중 가장 큰 미리보기 버전: 향상된 코딩 에이전트 실행, 향상된 프론트엔드 기술, 그리고 더 폭넓은 롱테일 지식.

3.5 버전 이상으로 크게 업그레이드된 비전 언어 모델: 에이전트 및 프론트엔드 코딩, 다중 모달 인식, OCR, 객체 위치 파악.
3.5 버전 이상으로 크게 업그레이드된 비전 언어 모델: 에이전트 및 프론트엔드 코딩, 다중 모달 인식, OCR, 객체 위치 파악.
256K 컨텍스트 플래그십으로, 추론, 지시 따르기, 다국어 지원이 크게 향상되었고 coding/math 정확도도 높아졌습니다.
2.5 시리즈보다 중국-영어 이해, 복잡한 지시, 다국어 구사력, 도구 사용 능력에서 크게 향상된 미리보기 릴리스.
복잡한 작업에서 더 높은 정확도를 위해 적응형 도구 사용(검색, 메모리, 코드 인터프리터)과 테스트 시간 확장 기능을 갖춘 추론 모델.

의미 문서 리랭커. 관련성에 따라 쿼리당 최대 500개의 후보를 정렬하며, 100+ 언어를 지원하고 맞춤형 정렬 명령어를 허용합니다.

강력한 프론트엔드 결과와 AI 코딩 도구 및 에이전트를 위한 다국어 프로그래밍 지원을 갖춘 코딩 튜닝된 256K 컨텍스트 모델입니다.

고빈도 기업용 작업 부하를 위한 균형 잡힌 범용 모델: 정보 처리, 콘텐츠, 검색, 데이터 분석.

256K 맥락, 네 가지 추론 노력 모드, image/video 이해를 갖춘 지연 중심 멀티모달 모델, 고동시성 사용을 위한 모델.

복잡한 추론, 다중 모달 이해, 구조화된 생성, 도구 보강 실행을 위한 256K 맥락의 대표 일반 모델입니다.

네이티브 오디오 싱크, 카메라 제어, 안정적인 움직임을 제공하는 시네마틱 클립용 속도 최적화 2.0 비디오 버전으로, 렌더링당 비용이 더 저렴합니다.

텍스트, 이미지, 오디오 또는 비디오 입력에서 시네마틱 출력을 위한 멀티모달 비디오 모델로, 안정적인 움직임과 일관된 캐릭터를 특징으로 합니다.

렌더링 전에 프롬프트를 통해 추론하여 고해상도의 일관된 편집과 브랜드 시각을 생성하는 통합 멀티모달 이미지 모델입니다.

프리미엄 Seedream 이미지 모델로, 한 이미지를 편집 가능한 레이어로 나누고, 좌표 또는 스케치 마커로 편집하며, 최대 10개의 참조를 융합합니다.

긴 형식의 다중 화자 팟캐스트 대화를 위한 오픈 소스 음성 모델로, 초언어적 제어(웃음, 한숨)와 제로 샷 음성 복제가 가능합니다.

텍스트 프롬프트에서 최대 3분의 오디오를 생성하며, 가능한 시간, 스텝, CFG 스케일과 함께 text-to-audio 및 audio-to-audio을 지원합니다.

음악 제작, 사운드 디자인, 리믹스를 위한 text-to-audio, audio-to-audio, 오디오 인페인팅을 더해 텍스트에서 to-3-minute 오디오 작업을 할 수 있습니다.

WAN 2.2의 Stable Video Infinity 2.0 Pro: 정지 이미지를 이론상 무한 길이의 비디오로 확장하면서 문자 ID를 일관되게 유지합니다.

주제를 탐구하고 출처를 분석하며 인용문이 포함된 상세한 연구 보고서를 작성하는 다중 검색 연구 보조원입니다.

크롤, 추출, URL 매핑을 통한 웹 검색을 통해 페이지와 도메인을 빠르게 구조화하여 하위 파이프라인을 검색할 수 있습니다.

선택 가능한 출력 크기를 가진 다국어 텍스트 임베딩(64–2048). 입력당 최대 8,192개의 토큰.

속도 최적화된 멀티모달 임베딩, Vision-Plus와 같은 형태, 3× 더 저렴한 image/video 토큰.

텍스트, 이미지, 비디오 입력에 대해 독립적인 벡터를 생성하는 멀티모달 임베딩.

멀티모달 비디오 생성 모델로, 네이티브 시청각 동기화(립싱크, 대사, 음악, 효과음)를 갖춘 시네마틱한 다중 샷 스토리를 지원합니다.

T2V, I2V, 비디오 편집, reference-to-video를 지원하는 멀티모달 비디오 모델로, 텍스트, 이미지 또는 비디오 입력에서 고충실도 출력을 제공합니다.

이미지 생성 및 편집 동반 모델: text-to-image, 경계 박스 편집, 그리고 일관된 이미지 세트, Pro에서 최대 4K 출력 지원.
다국어 ASR, 번역, VAD, 타임스탬프, 자막, 핫워드, 디코더 컨트롤을 포함한 제어된 Whisper Large v3 터보 전사.

고수준 프롬프트를 하위 작업으로 전환하고, 도구와 API를 호출하며, 수동 오케스트레이션 없이 end-to-end 결과를 제공하는 자율 AI 에이전트입니다.

텍스트-비디오, image-to-video, reference-to-video 생성이 가능하며, 일관된 문자를 위해 최대 7개의 참조 이미지가 가능하며, 1080p에서 최대 15초가 가능합니다.

에이전트 워크플로우, 복잡한 소프트웨어 엔지니어링, 장기 작업 작업을 위한 최상위 모델로, 1000+ 개의 도구 호출과 100만 개의 컨텍스트에서 작업을 지속할 수 있습니다.

100만 맥락에서 네이티브 시각 및 청각 이해를 가진 멀티모달 모델로, 에이전트 워크플로우에서 다양한 모달리즘을 이론하고 행동하도록 설계되었습니다.

텍스트, 이미지, reference-to-video 하나의 모델에 담겨 있습니다. 시네마틱 모션, 최대 9개의 참조에 걸친 캐릭터 일관성, 그리고 동기화된 네이티브 오디오.

가장 빠르고 저렴한 Seedance 2.0 등급으로, 480p 및 720p 해상도의 네이티브 오디오, 카메라 제어, 이미지 또는 비디오 입력이 가능한 짧은 시네마틱 클립을 지원합니다.

StepFun은 이미지 및 비디오 입력, 도구 호출, 조정 가능한 추론 노력, 그리고 256K 컨텍스트를 갖춘 다중 모달 추론 모델입니다.

StepFun은 에이전트, 코딩, 툴 호출, 장기 맥락 분석을 위한 텍스트 추론 모델입니다.

에이전트 최적화 Step 3.5 플래시 변형은 추론 노력 모드와 추론 노력 모드가 모두 가능합니다.

StepFun 오디오 및 텍스트 대화 모델, 텍스트 출력과 준언어적 이해를 지원합니다.

StepFun은 text-to-image 및 단일 이미지 편집을 위한 이미지 생성 및 이미지 편집 모델입니다.

맥락 기반 StepFun text-to-speech 자연어 음성 지시와 표현력 전달을 갖춘 모델입니다.

StepFun text-to-speech 공식 음성, 맞춤형 복제 음성, 음성 태그 컨트롤이 포함된 모델입니다.

StepFun은 중국어 및 영어 오디오 전사를 위한 스트리밍 음성 인식 모델입니다.

차세대 코딩 및 에이전트 모델을 갖춘 엔지니어링 수준의 코드 전달, 장기 자율성, 256K 멀티모달 이해를 제공합니다.

1,000개 이상의 음성, 16개 언어, 20개의 중국 방언, 자연어 전달 방향, 인라인 감정 태그를 갖춘 계층별 음성 합성.

텍스트, 이미지, 비디오, 오디오 참조를 한 번의 요청으로 따라가며 최대 2K에서 4초에서 15초짜리 클립을 네이티브 스테레오 오디오로 생성합니다.

OpenAI의 대표 이미지 모델로, 강한 프롬프트 정확도, 선명한 텍스트 렌더링, 최대 16개의 참조 이미지에 걸친 지시 기반 편집을 지원합니다.

쿠아이쇼우의 Kling 3.0 비디오 생성기로, text-to-video, 첫 프레임과 마지막 프레임 image-to-video, 네이티브 오디오, 720p, 1080p, 또는 4K 출력이 가능합니다.

알리바바의 Wan 2.5 비디오 모델로, text-to-video 및 image-to-video, 네이티브 오디오, 선택 가능한 커스텀 오디오 트랙, 480p에서 1080p 출력 지원.

알리바바의 완 2.2 비디오 패밀리로, 표준 및 플래시 티어, 첫 프레임과 마지막 프레임 보간, 그리고 저비용으로 480p에서 1080p 출력이 가능합니다.

알리바바의 Wan 2.1 비디오 모델은 터보 및 text-to-video, image-to-video, 첫 프레임과 마지막 프레임 클립을 위한 플러스 티어를 480p 또는 720p 해상도로 제공합니다.

알리바바의 완 2.5 이미지 모델은 약 170만 화소에서 최대 3장의 이미지를 text-to-image 및 다중 참조 편집이 가능합니다.

알리바바의 완 2.2 text-to-image 모델은 플러스 및 플래시 티어를 제공하며, 최대 1440x1440 출력 해상도를 저렴한 이미지당 가격으로 제공합니다.

알리바바의 완 2.1 text-to-image 모델은 터보 및 플러스 티어를 갖추고 최대 1440x1440 출력 지원, 이미지당 저렴한 가격입니다.

최대 30초의 일관된 클립을 위한 장기 비디오 모델, 최대 50개의 참조 이미지, 비디오, 오디오 클립, 네이티브 오디오, 편집 및 확장을 지원합니다.

텍스트-이미지 변환과 다중 참조 편집, 최대 5개의 소스 이미지, 자동 또는 고정 품질 등급, 1K 또는 2K 출력 해상도가 가능합니다.

텍스트, 이미지, 첫 프레임과 마지막 프레임, 또는 최대 7개의 참조 자료를 통해 비디오를 생성하며, 네이티브 오디오, 다중 컷, 클립 확장이 가능합니다.

텍스트, 이미지, 첫 프레임과 마지막 프레임, 또는 참조 자료를 활용한 액션 및 효과 작업을 위한 시네마급 비디오 모델로, 네이티브 동기화된 오디오가 제공됩니다.

기존 영상의 입 움직임을 업로드된 오디오 트랙이나 14개의 내장 음성 중 하나가 말하는 텍스트와 정렬합니다.
단일 초상화를 업로드된 오디오 트랙이나 내장 음성 텍스트로 구동되는 말하는 아바타 영상으로 변환합니다.

한 모델에 6가지 비디오 변환이 가능하다: 프롬프트 편집, 스타일링 변경, 피사 전환, 모션 전송, 업스케일링, 생성 효과음.

밀리초 립싱크가 포함된 공동 오디오 및 비디오 생성, 6개 언어 대사, 시네마틱 카메라 움직임, 최대 1080p 출력.

최대 14장의 참조 이미지, 강력한 텍스트 렌더링, 그리고 2K 또는 4K 출력이 단일 가격에 제공되는 고충실도 이미지 생성 및 편집이 가능합니다.

최대 14장의 참조 이미지, 최대 15장의 배치 세트, 그리고 1K에서 4K 단위의 출력 모두 하나의 고정 가격으로 통합 이미지 생성 및 편집이 가능합니다.

Rodin Gen-2 엔진은 텍스트 프롬프트나 최대 다섯 개의 참조 이미지를 PBR 재질과 쿼드 또는 원시 메시를 갖춘 생산 3D 자산으로 변환합니다.

구조 인식 텍스처를 적용한 프로덕션 중심의 이미지 투 3D, 1536 및 1536 Pro 정밀 티어, 최대 200만 개의 얼굴 메시, 그리고 5가지 내보내기 포맷.

텍스트, 이미지, 비디오를 하나의 1024 또는 2048 차원 벡터로 융합하여 교차 모달 검색 및 검색을 가능하게 하는 다중 모달 임베딩입니다.

최대 30초의 올인원 비디오 생성, 네이티브 오디오, 옴니모달 참조(이미지, 비디오, 오디오, 파일, 웹 링크), 그리고 빠른 Prime 등급을 지원합니다.

100만 개의 맥락, 이미지 입력, 웹 검색 기능을 갖춘 적절한 규모의 전문가 팀을 구성하는 비용 효율적인 다중 에이전트 컨덕터입니다.

가장 어려운 추론, 코딩, 연구 작업을 위한 대표적인 다중 에이전트 지휘자이며, 100만 개의 맥락, 이미지 입력, 웹 검색 기능을 지원합니다.
163 / 182 모델