우리는 Qwen3.8 플래시·, 딥시크 V4.1 플래시·, MiMo V2.6 플래시 그리고 3.7단계 플래시 네 번의 원샷 코딩 테스트를 서로 대결하며, 모두 EmpirioLabs에서 실행됩니다. 모두 같은 프롬프트, 한 번의 샷, 편집 없이, 모든 결과가 실제 브라우저에서 실시간으로 렌더링됩니다.
네 방향 비교를 시청하세요
사양 한눈에
| Qwen3.8 플래시 | 딥시크 V4.1 플래시 | MiMo V2.6 플래시 | 3.7단계 플래시 | |
|---|---|---|---|---|
| 메이커 | 알리바바 | 딥시크 | 샤오미 | 스텝펀 |
| 컨텍스트 윈도우 | 1,000,000 토큰 | 1,000,000 토큰 | 1,000,000 토큰 | 256,000 토큰 |
| 입력 | 텍스트, 이미지 및 비디오 | 텍스트 및 이미지 | 텍스트, 이미지, 비디오 및 오디오 | 텍스트, 이미지 및 비디오 |
| 이유 | 최대 노력 | 최대 노력 | 생각을 켜거나 꺼지거나요 | 최대 노력 |
| 구조화된 출력 | 엄격한 JSON 스키마 | JSON 모드 | 엄격한 JSON 스키마 | JSON 모드 |
| 투입 가격 | 100만 토큰당 $0.16 | 100만 토큰당 $0.30 | 100만 토큰당 $0.14 | 100만 토큰당 $0.20 |
| 출력 가격 | 100만 토큰당 $0.47 | 100만 토큰당 $1.20 | 100만 토큰당 $0.28 | 100만 토큰당 $1.15 |
우리가 진행한 방법
각 모델은 네 가지 작업에 대해 동일한 프롬프트를 받았습니다: 단일 HTML 파일로 밤에 관람차를 만들기; 하나의 HTML 파일로 나무 불 오븐에서 피자 굽기; 단일 HTML 파일에서 장난감 기차 세트를 만들기; 단일 HTML 파일에서 해변 위를 날아다니는 연을 만들기. 모든 작업은 외부 라이브러리가 없는 독립적인 HTML 파일을 요청하며 스스로 애니메이션을 재생했습니다. Qwen3.8 플래시, 딥시크 v4.1 플래시, 그리고 스텝 3.7 플래시는 reasoning_effort: "맥스"; 노력 설정이 없는 MiMo V2.6 Flash는 사고 모드로 실행되었습니다. 모든 모델은 65,536 토큰 출력 예산과 작업당 한 번의 샷을 가졌습니다. 각 패널의 라인 수와 tokens-per-second 판독값은 실제 API 호출에서 측정되며, 각 결과는 모델이 반환한 파일을 있는 그대로 렌더링한 것입니다.
무엇을 찾아야 하는지
DeepSeek V4.1 Flash는 초당 약 191개의 토큰으로 가장 빠르게 파일을 반환했습니다. MiMo V2.6 Flash는 평균 약 930줄의 가장 긴 파일을 작성했고, Step 3.7 Flash는 약 490줄로 가장 압축적이었습니다. Qwen3.8 Flash는 작업 기준 포함 작업 당 약 48,000개의 출력 토큰을 가장 많이 사용했습니다. 각 모델이 장면에 생명을 불어넣는 모션, 디테일, 그리고 스스로 계속 작동하는 방식을 지켜보세요. 우리는 승자를 선언하는 것이 아닙니다. 클립을 실행하고 자신의 사용 사례에 맞게 출력을 판단하세요.
같은 테스트를 EmpirioLabs
curl https://api.empiriolabs.ai/v1/chat/completions \ -h "인증: 보유자 $EMPIRIOLABS_API_KEY" \ -h "내용 유형: application/json" \ -d '{ "model": "qwen3-8-flash", "reasoning_effort": "max", "messages": [{"role": "user", "content": "단일 HTML 파일로 밤에 관람차를 만들기."}] }'
스왑 모델 번호: 로 deepseek-v4-1-flash·, mimo-v2-6-flash 또는 step-3-7-flash 같은 요청을 다른 것들에 대해 실행하거나, 대화형으로 시도하는 방법 뚱 베어·.
자주 묻는 질문
결과가 수정되었거나 재시도되었나요?
아니요. 각 패널은 모델이 해당 프롬프트에 대해 처음 반환한 파일로, 반환된 그대로 렌더링된 것입니다. 파일 없이 돌아온 요청은 다시 전송되었습니다.
왜 가장 높은 논리 설정인가요?
공정한 대결 비교는 각 모델이 최고의 모습을 보여주므로, 각 모델은 최고 기준으로 실행되었습니다: Qwen3.8 Flash는 최대 노력, DeepSeek V4.1 Flash, Step 3.7 Flash는 MiMo V2.6 Flash에 대해서도 생각해보세요.
어떤 모델을 사용해야 할까요?
MiMo V2.6 플래시는 네 가지 중 출력 가격이 가장 저렴합니다. 결정하기 전에 각각 작업량을 직접 비교해 보세요: 같은 요청이 모델 이름만 바꿀 뿐 모두 작동합니다.



