우리는 키미 K3·, GLM 5.3·, Qwen3.8 맥스 그리고 딥시크 V4 프로 0813 네 번의 원샷 코딩 테스트를 서로 대결하며, 모두 EmpirioLabs에서 진행됩니다. 같은 프롬프트, 한 번의 시도, 편집이나 재시도 없이, 모든 결과가 실제 브라우저에서 실시간으로 렌더링됩니다.
네 방향 비교를 시청하세요
사양 한눈에
| 키미 K3 | GLM 5.3 | Qwen3.8 맥스 | 딥시크 V4 프로 0813 | |
|---|---|---|---|---|
| 메이커 | 문샷 AI | Z.ai | 알리바바 | 딥시크 |
| 컨텍스트 윈도우 | 1,000,000 토큰 | 1,000,000 토큰 | 1,000,000 토큰 | 1,000,000 토큰 |
| 입력 | 텍스트, 이미지 및 비디오 | 본문 | 텍스트, 이미지 및 비디오 | 본문 |
| 추론 제어 | reasoning_effort, 저에서 최대까지 | reasoning_effort, 저에서 최대까지 | reasoning_effort, 최대치까지 없음 | reasoning_effort, 최대치까지 없음 |
| 구조화된 출력 | 엄격한 JSON 스키마 | JSON 모드 | 엄격한 JSON 스키마 | 엄격한 JSON 스키마 |
| 투입 가격 | 100만 토큰당 $3.00 | 100만 토큰당 $1.40 | 100만 토큰당 $2.00 | 100만 토큰당 $1.32 |
| 출력 가격 | 100만 토큰당 $15.00 | 100만 토큰당 $4.40 | 100만 토큰당 $6.00 | 100만 토큰당 $3.96 |
우리가 진행한 방법
각 모델은 네 가지 작업에 대해 동일한 프롬프트를 받았다: 애니메이션 A* 탐색으로 생성 및 스스로 해결하는 미로, 낙하하는 모래 시뮬레이션, 파도를 타는 돛단배가 있는 바다 노을, 그리고 밤에 창문을 타고 내리는 빗소리. 모든 과제는 외부 라이브러리가 없는 단일 독립형 HTML 파일을 요구했다. 네 가지 모델 모두 reasoning_effort: "맥스" 65,536 토큰 출력 예산, 원샷, 재시도 없음. 각 패널의 라인 수와 tokens-per-second 판독값은 실제 API 호출에서 측정되며, 각 결과는 모델이 반환한 파일을 있는 그대로 렌더링한 것입니다.
무엇을 찾아야 하는지
DeepSeek V4 Pro 0813은 초당 약 100개의 토큰으로 가장 빠르게 파일을 반환했습니다. Qwen3.8 Max는 평균 약 540줄로 가장 긴 파일을 작성했고, Kimi K3는 약 360줄로 가장 압축적이었습니다. GLM 5.3은 작업 기준으로 약 47,000개의 출력 토큰을 사용했습니다. 각 모델이 미로 탐색을 애니메이션화하고, 모래를 쌓고, 파도를 움직이고, 빗방울을 합치는 방식을 지켜보세요. 우리는 승자를 선언하지 않습니다. 클립을 실행하고 자신의 사용 사례에 맞게 출력을 판단하세요.
같은 테스트를 EmpirioLabs
curl https://api.empiriolabs.ai/v1/chat/completions \ -h "인증: 보유자 $EMPIRIOLABS_API_KEY" \ -h "콘텐츠-유형: application/json" \ -d '{ "model": "kimi-k3", "reasoning_effort": "max", "messages": [{"role": "user", "content": "하나의 HTML 파일로 생성하고 해결하는 미로를 구축하세요."}] }'
스왑 모델 번호: 로 glm-5-3·, qwen3-8-max 또는 deepseek-v4-pro-0813 같은 요청을 다른 것들에 대해 실행하거나, 대화형으로 시도하는 방법 뚱 베어·.
자주 묻는 질문
결과가 수정되었거나 재시도되었나요?
아니. 각 모델은 동일한 프롬프트로 작업당 한 번씩 시도할 수 있었고, 렌더링된 결과는 반환된 파일과 정확히 일치합니다.
왜 맥스 추론을 선택할까요?
공정한 1:1 경기에서 각 모델이 최고의 모습을 보여줍니다. 네 모델 모두 EmpirioLabs에서 reasoning_effort 컨트롤을 노출시켜 최고 설정으로 작동했습니다.
어떤 모델을 사용해야 할까요?
DeepSeek V4 Pro 0813은 네 모델 중 토큰당 가격이 가장 낮고, 여기서 가장 빠르게 답변했습니다. Kimi K3와 Qwen3.8 Max는 텍스트뿐만 아니라 이미지와 동영상도 지원합니다. GLM 5.3은 가격 면에서 DeepSeek와 비슷합니다. 결정하기 전에 각자의 작업 부하를 비교해 보세요.



