
Text-zu-Video und image-to-video mit synchronisiertem nativem Audio, auf 720p oder 1080p für 3 bis 15 Sekunden, mit Seitenverhältnis und Prompt-Steuerung.
Zahlen Sie nach Beginn, oder wählen Sie einen Plan mit wöchentlichen Zulagen.
Preiskatalog
Die Preise von EmpirioLabs variieren je nach Modell und Einheit: Tokens, Bilder, Sekunden Audio oder Video, Nachrichten, 3D-Assets und Suchanfragen. Die interaktive Preistabelle lädt den aktuellen Katalog, während diese repräsentativen Preise ohne Client-JavaScript lesbar bleiben.
Bildeingabe $0.05 pro Bild. Die Videoausgabe beginnt mit $0.096 pro Sekunde für 480p und $0.168 pro Sekunde für 720p.
Die Eingabe beginnt bei $0.40 pro 1 Million Prompt-Tokens für eine kosteneffiziente multimodale API mit langem Kontext.
Die Eingabe beginnt bei $0.30 pro 1 Million Prompt-Tokens für multimodales Denken, Codieren und Agenten-Workloads.
Die Bild-zu-3D-Generierung wird pro generiertem 3D-Asset bepreist, mit Dokumenten für Format- und Auflösungskontrollen.
Modell-API-Tarife werden in USD angezeigt und abgerechnet. Der Checkout kann lokale Zahlungsmethoden anzeigen, wenn sie verfügbar sind.
Weekly allowances across models, media, search and tasks, on top of pay as you go. Usage inside your allowances is included and never touches your credit balance.
3 of these are free to run, so they never draw from your allowance.
DeepSeek V4 Flash 0731
Qwen3.7 Flash
Qwen3.7 Flash (Variant 1)
MiniMax M3
MiniMax M3 (Priority)
Step 3.7 Flash
DeepSeek V4 Flash (Variant 2)
DeepSeek V4 Flash
DeepSeek V4 Flash (Variant 1)
Qwen3.6 Flash
Qwen3.6 Flash (Variant 1)
Qwen3.6 35B A3B
Step 3.5 Flash 2603
Gemma 4 26B-A4B
MiniMax M2.7 Highspeed
MiniMax M2.7
Mistral Small 4
Qwen3.5 4B
Qwen3.5 122B-A10B
Qwen3.5 35B-A3B
Qwen3.5 27B
Qwen3.5 Flash (Variant 1)
Qwen3.5 Flash
Qwen3.5 9B
Qwen3.5 397B-A17B
Seed 2.0 Mini
Step 3.5 Flash
GLM 4.7 FlashKostenlosThis model is free to run, so using it never draws from your weekly allowance.
GLM 4.6V FlashKostenlosThis model is free to run, so using it never draws from your weekly allowance.
GLM 4.5 FlashKostenlosThis model is free to run, so using it never draws from your weekly allowance.
Mistral Medium 3
Mistral Small 3.1
Gemma 3 27B
Nova Lite 1.0
Nova Micro 1.0
Muse Spark 1.2
Qwen3.8 Max
Qwen3.8 Max (Variant 1)
Fugu Ultra v1.1
Kimi K3
Seed 2.1 Turbo
Muse Spark 1.1
Fugu Ultra v1.0
Kimi K2.7 Code
GLM 5.2
Kimi K2.7 Code Highspeed
GLM 5.2 (Variant 1)
Kimi K2.7 Code (Variant 1)
Qwen3.7 Plus
Qwen3.7 Plus (Variant 1)
Qwen3.7 Max
Qwen3.7 Max (Variant 1)
MiMo V2.5 Pro
DeepSeek V4 Pro (Variant 2)
DeepSeek V4 Pro
DeepSeek V4 Pro (Variant 1)
Qwen3.6 27B
MiMo V2.5
Kimi K2.6
Qwen3.6 Max Preview
GLM 5.1
Qwen3.6 Plus (Variant 1)
Qwen3.6 Plus
Qwen3.5 Omni Flash
Qwen3.5 Omni Plus
Qwen3.5 Plus (Variant 1)
Qwen3.5 Plus
Seed 2.0 Code
Seed 2.0 Lite
Seed 2.0 Pro
Nova Lite 2
DeepSeek V3.2
Qwen3 Max
Qwen3 Max Thinking
Qwen3 Max Preview
Mistral Medium 3.1
Nova Premier 1.0
DeepReasoning
Nova Pro 1.0
Perplexity Sonar
StepAudio 2.5 ChatAllowances cover models, media, search and tasks, including generation templates and Compose. Past them, usage bills at normal pay-as-you-go rates. Personal use only, no reselling. Allowances refresh weekly and do not roll over.

Text-zu-Video und image-to-video mit synchronisiertem nativem Audio, auf 720p oder 1080p für 3 bis 15 Sekunden, mit Seitenverhältnis und Prompt-Steuerung.

Logik- und Codierungsmodell mit einem 1M Token-Kontext, 128K-Ausgabe, anpassbarem Schlussfolgerungsaufwand, nativer Websuche und Werkzeugaufrufen.

Logik- und Codierungsmodell mit einem 1M Token-Kontext, 128K-Ausgabe, anpassbarem Schlussfolgerungsaufwand, nativer Websuche und Werkzeugaufrufen.

Moonshot AIInternationalVeröffentlicht 15. Juli 2026Ctx 1MTextgenerierungKimi K3 ist Moonshots Flaggschiff-Logikmodell mit einem 1-Millionen-Token-Kontext, ständigem Denken, nativer Websuche sowie Text-, Bild- und Videoeingaben.

Metas aktualisiertes Frontier-Reasoning-Modell mit einem Kontext von 1.048.576 Tokens, Bild-, Video-, Audio- und PDF-Verständnis, Websuche und Werkzeugaufrufen.

Moonshot AIInternationalVeröffentlicht 16. Juni 2026Ctx 256KTextgenerierungKimi K2.7 Code ist Moonshots agentisches Codierungsmodell mit Billionen Parametern und 256K-Kontext, ständigem Denken sowie Text-, Bild- und Videoeingaben.

Moonshot AIGermanyVeröffentlicht 16. Juni 2026Ctx 256KTextgenerierungKimi K2.7 Code ist Moonshots agentisches Codierungsmodell mit Billionen Parametern und 256K-Kontext, ständigem Denken sowie Text-, Bild- und Videoeingaben.

Meta-Frontier-Denkmodell mit einem Kontext von 1.048.576 Tokens sowie Bild-, Video-, Audio- und PDF-Verständnis, Websuche und Werkzeugaufrufen.

Aktualisierter Multi-Agent-Conductor für hartes Denken, Codieren und Recherche, mit klarem Maximalaufwand, 1 Million Kontext, Bildeingabe und Websuche.

Alibaba CloudSingaporeVeröffentlicht 1. Juni 2026Ctx 1MTextgenerierungKostengünstiges Qwen3.7 Vision-Sprachmodell für Text, Bild, Video, Codierung, Werkzeugnutzung, GUI-Verständnis und 1M-Kontext-Workflows.

Alibaba CloudChinaVeröffentlicht 1. Juni 2026Ctx 1MTextgenerierungKostengünstiges Qwen3.7 Vision-Sprachmodell für Text, Bild, Video, Codierung, Werkzeugnutzung, GUI-Verständnis und 1M-Kontext-Workflows.

Moonshot AIInternationalVeröffentlicht 16. Juni 2026Ctx 256KTextgenerierungKimi K2.7 Code Highspeed ist die schnellere Stufe des agentischen Codingmodells von Moonshot, mit 256K-Kontext, ständiger Logik sowie Bild- und Videoeingaben.

Originaler Multi-Agent-Leiter für hartes Schließen, Codieren und Recherche, mit 1M-Kontext, Bildeingabe, Funktionsaufrufen und Websuche.

Alibaba CloudSingaporeVeröffentlicht 15. Juli 2026Ctx 1MTextgenerierungSchnelles Qwen3.7 Vision-Sprachmodell für Text, Bild, Video, Werkzeugnutzung und agentische Aufgaben, mit implizitem Caching und einem 1M Token-Kontext.

Alibaba CloudChinaVeröffentlicht 15. Juli 2026Ctx 1MTextgenerierungSchnelles Qwen3.7 Vision-Sprachmodell für Text, Bild, Video, Werkzeugnutzung und agentische Aufgaben, mit implizitem Caching und einem 1M Token-Kontext.

MiniMax M3 ist ein multimodales Denkmodell für Codierung, Agenten und Langkontextanalysen mit Text-, Bild- und Videoeingang.

MiniMax M3 ist ein multimodales Denkmodell für Codierung, Agenten und Langkontextanalysen mit Text-, Bild- und Videoeingang.

Alibaba CloudSingaporeVeröffentlicht 21. Mai 2026Ctx 1MTextgenerierungQwen3.7 Max ist ein Flaggschiff-Textmodell für Coding, Produktivität, langlaufende Agenten, tiefes Denken, Werkzeuge und 1M-Token-Kontext.

Alibaba CloudChinaVeröffentlicht 21. Mai 2026Ctx 1MTextgenerierungQwen3.7 Max ist ein Flaggschiff-Textmodell für Coding, Produktivität, langlaufende Agenten, tiefes Denken, Werkzeuge und 1M-Token-Kontext.

Alibaba CloudSingaporeVeröffentlicht 3. Aug. 2026Ctx 1MTextgenerierungMoE-Flaggschiff im Billionenmaßstab für Programmierung, langfristige Agenten und professionelle Arbeit, mit Bild- und Videoverständnis über einen 1M-Token-Kontext.

Alibaba CloudChinaVeröffentlicht 3. Aug. 2026Ctx 1MTextgenerierungMoE-Flaggschiff im Billionenmaßstab für Programmierung, langfristige Agenten und professionelle Arbeit, mit Bild- und Videoverständnis über einen 1M-Token-Kontext.

Open-Source-Musikgenerierungsmodell für text-to-song und textgesteuerte Audio, mit schneller 8-Stufe XL Turbo-Inferenz für steuerbare Song-Iteration.

Black Forest LabsVeröffentlicht 15. Jan. 2026BilderzeugungApache-lizenziertes 4B FLUX.2 Klein-Bildgenerierungs- und Bearbeitungsmodell mit text-to-image, Referenzbildbearbeitung und kreativer Workflow-Unterstützung.

MiniMaxSingaporeVeröffentlicht 18. März 2026Ctx 200KTextgenerierungHochgeschwindigkeits-M2.7-Variante, abgestimmt für schnelle Inferenz mit starker Allzweckleistung und starken agentischen Fähigkeiten.
Echtzeit-Sprachmodell mit einfacher englischer Sprachsteuerung, einer Sprachidentität in 100+ Sprachen und Streaming-time-to-first-audio unter 200 ms.

Sub-130ms TTFB Sprachsynthese mit 271+ Stimmen in 15 Sprachen, expressive Prosodie und Echtzeit-SSE-Streaming für Sprachagenten mit niedriger Latenz.
Sprachsynthese in Broadcast-Qualität mit reichhaltiger ausdrucksstarker Prosodie, 271+ Stimmen in 15 Sprachen und Echtzeit-SSE-Streaming mit Zeitstempeln pro Wort.

Langkontext-Zhipu-KI-Schlussfolgerungsmodell mit 202K-Kontext, 128K-Ausgabe, Werkzeugaufruf, strukturierter Ausgabe und Cache-Unterstützung.

Kimi K2.6 ist ein Moonshot-multimodales Logikmodell mit 256K-Kontext, starker Codierung sowie Text-, Bild- und Videoeingaben.

DeepSeekGermanyVeröffentlicht 31. Juli 2026Ctx 1MTextgenerierungNachtrainierte 0731-Veröffentlichung mit großen Fortschritten bei Coding, Repository-Arbeit, Werkzeugnutzung und Full-Stack-Aufgaben sowie einem 1-Million Kontextfenster.

MiniMaxSingaporeVeröffentlicht 18. März 2026Ctx 200KTextgenerierungMiniMax M2.7 ist ein allgemeines Denk-Chat-Modell mit verflokenem Denken, Funktionsaufrufen und promptem Caching.
TRELLIS.2 Bild-zu-3D-Modell, das ein Referenzbild in ein strukturiertes GLB-Asset mit Auflösung, Seed, Mesh, Textur und Exportkontrollen verwandelt.

Alibaba CloudChinaVeröffentlicht 24. Feb. 2026Ctx 256KTextgenerierungQwen3.5 122B-A10B ist ein multimodales Denkmodell mit 256K-Kontext, effizienter Sparse-MoE-Inferenz sowie Text-, Bild- und Videoeingang.

Alibaba CloudChinaVeröffentlicht 16. Feb. 2026Ctx 256KTextgenerierungQwen3.5 397B-A17B ist ein flaggschiffartiges multimodales Schlussfolgerungsmodell für Sprache, Code, Agenten, GUI-Aufgaben sowie Bild- und Videoverständnis.

Alibaba CloudChinaVeröffentlicht 24. Feb. 2026Ctx 256KTextgenerierungQwen3.5 35B-A3B ist ein effizientes natives Vision-Sprachmodell mit spärlichem MoE-Routing, tiefem Denken sowie Text-, Bild- und Videoeingaben.

Alibaba CloudChinaVeröffentlicht 24. Feb. 2026Ctx 256KTextgenerierungQwen3.5 27B ist ein dichtes multimodales Denkmodell mit schnellen Antworten, 256K-Kontext sowie Text-, Bild- und Videoverständnis.

Alibaba CloudChinaVeröffentlicht 22. Apr. 2026Ctx 256KTextgenerierungQwen3.6 27B verbessert das agentische Codieren, MINT-Denken, räumliches Sehen, OCR sowie das Verständnis von Text, Bild und Video im 256K-Kontext.

Alibaba CloudSingaporeVeröffentlicht 16. Apr. 2026Ctx 1MTextgenerierungSchnelles Qwen3.6-Vision-Sprachmodell für agentisches Codieren, mathematisches Denken, räumliches Verstehen, OCR sowie Text-, Bild- und Videoeingaben.

Alibaba CloudChinaVeröffentlicht 16. Apr. 2026Ctx 1MTextgenerierungSchnelles Qwen3.6-Vision-Sprachmodell für agentisches Codieren, mathematisches Denken, räumliches Verstehen, OCR sowie Text-, Bild- und Videoeingaben.

GoogleVeröffentlicht 31. März 2026Ctx 256KTextgenerierungGemma 4 26B A4B ist ein Google-offenes multimodales Modell mit 256K-Kontext, Text-, Bild- und Videoeingaben, Werkzeugen und strukturierter Ausgabe.

Alibaba CloudVeröffentlicht 23. Feb. 2026Ctx 256KTextgenerierungQwen3.5 9B ist ein kompaktes multimodales Schlussfolgerungsmodell mit 256K Kontext, Bild- und Videoeingaben, Funktionswerkzeugen und strukturierter Ausgabe.

Alibaba CloudVeröffentlicht 2. März 2026Ctx 256KTextgenerierungQwen3.5 4B ist ein kostengünstiges multimodales Schlussfolgerungsmodell mit 256K Kontext, Bild- und Videoeingabe, Funktionswerkzeugen und strukturierter Ausgabe.

Alibaba CloudVeröffentlicht 16. Apr. 2026Ctx 128KTextgenerierungQwen3.6 35B A3B ist ein 256-fachkundiges mixture-of-experts Schlussfolgermodell mit 128K Kontext, Funktionswerkzeugen und streng strukturierter JSON-Ausgabe.

Z.aiSingaporeVeröffentlicht 19. Jan. 2026Ctx 200KTextgenerierungKostenloses leichtes GLM-4.7-Textmodell für Codierung, Argumentation, Langkontext-Schreiben und allgemeinen Chat.

Z.aiSingaporeVeröffentlicht 28. Juli 2025Ctx 200KTextgenerierungKostenloses leichtes GLM-4.5-Textmodell für Argumentation, Codierung, Langform-Chat und allgemeine Sprachaufgaben.

Z.aiSingaporeVeröffentlicht 8. Dez. 2025Ctx 128KTextgenerierungKostenloses multimodales GLM-4.6V-Modell für Bild-, Video-, Datei- und Textverständnis mit nativem Funktionsaufruf.

Bildgenerierung und -bearbeitung Modelle, die Bilder aus Text oder Bildeingaben erstellt und modifiziert, mit Inpainting-, virtuellen Anprobierungs- und Stilsteuerungen.

Videogenerierungsmodell, das bis zu 2-minütige Mehrfachaufnahme-Videos aus Text und optionalen Bildeingaben mit verbesserter Qualität und Konsistenz erzeugt.

Sprach-zu-Text-Transkription mit dem Nova-3-Modell mit mehrsprachiger Unterstützung und fortschrittlichen anpassbaren Einstellungen für Produktionsarbeitslasten.

Verbindet DeepSeek R1 chain-of-thought Argumentation mit Anthropic Claude – kreativer und Code-Generierung hinter einer einheitlichen, datengesteuerten Schnittstelle.

DeepSeekSingaporeVeröffentlicht 1. Dez. 2025Ctx 128KTextgenerierungOpen-Source Mix-of-Experts LLM, optimiert für effizientes Schließen, Codieren und allgemeine Sprachaufgaben über Langform-Prompts.

DeepSeekGermanyVeröffentlicht 24. Apr. 2026Ctx 1MTextgenerierungLeichtes MoE-Modell mit insgesamt 284 Milliarden / 13 Milliarden aktiven Parametern und nativem 1M Kontext, abgestimmt auf eine niedrige Latenz und kosteneffiziente Nutzung mit hoher Nebenläufigkeit.

DeepSeekSingaporeVeröffentlicht 24. Apr. 2026Ctx 1MTextgenerierungLeichtes MoE-Modell mit insgesamt 284 Milliarden / 13 Milliarden aktiven Parametern und nativem 1M Kontext, abgestimmt auf eine niedrige Latenz und kosteneffiziente Nutzung mit hoher Nebenläufigkeit.

DeepSeekChinaVeröffentlicht 24. Apr. 2026Ctx 1MTextgenerierungLeichtes MoE-Modell mit insgesamt 284 Milliarden / 13 Milliarden aktiven Parametern und nativem 1M Kontext, abgestimmt auf eine niedrige Latenz und kosteneffiziente Nutzung mit hoher Nebenläufigkeit.

DeepSeekGermanyVeröffentlicht 24. Apr. 2026Ctx 1MTextgenerierungFlaggschiff-MoE-LLM mit insgesamt 1,6T / 49B aktiven Parametern und nativem 1M-Kontext für fortgeschrittene Mathematik, logische Inferenz und spezialisierte Programmierung.

DeepSeekSingaporeVeröffentlicht 24. Apr. 2026Ctx 1MTextgenerierungFlaggschiff-MoE-LLM mit insgesamt 1,6T / 49B aktiven Parametern und nativem 1M-Kontext für fortgeschrittene Mathematik, logische Inferenz und spezialisierte Programmierung.

DeepSeekChinaVeröffentlicht 24. Apr. 2026Ctx 1MTextgenerierungFlaggschiff-MoE-LLM mit insgesamt 1,6T / 49B aktiven Parametern und nativem 1M-Kontext für fortgeschrittene Mathematik, logische Inferenz und spezialisierte Programmierung.

Schnelle LLM-ähnliche Antwort auf eine Frage in natürlicher Sprache, basierend auf frischen Exa-Websuchergebnissen mit Inline-Zitaten und Quelllinks.

Websuchmaschine zum Finden von Seiten, zum Abrufen ähnlicher Seiten, zum Crawlen und zur gezielten Codesuche im offenen Web nach KI-Agenten.

Latenzarte text-to-speech mit Ein- und Mehrlautsprecherstimmen sowie steuerbarem Stil, Akzent und ausdrucksstarkem Klang für Produktions-Apps.

Hochwertige TTS-Vorschau für Podcasts, Hörbücher und Kundensupport mit ausdrucksstarken Mehrsprecherstimmen in 23+ Sprachen.

Hochkontrollierbares TTS mit neuen Audio-Tags für präzisen Stil, Ton, Tempo und Vortrag über Erzählung, Assistenten und Sprach-Apps.

Open-Source-Vision-Sprachmodell mit 128K Kontext, 140+ Sprachen, verbesserter math/reasoning, strukturierten Ausgaben und Funktionsaufrufen.

LLM-basierte text-to-speech mit Zero-Shot-Sprachklonen aus 3-10 Sekunden Audio und emotionsausdrucksstarkem, steuerbarem Output über Multi-Reward RL.

Deep-Learning-Detektor, der Textabschnitte markiert, die wahrscheinlich von KI im Vergleich zu Menschen generiert wurden, und Inhalte als vollständig menschlich, KI oder gemischt klassifiziert.

Das Videomodell bietet Text-zu-Video-, Bild-zu-Video-, Referenz-zu-Video- und Videobearbeitungsmodi mit hochauflösender, bewegungsglatter Ausgabe.

Open-Source-text-to-image modelliert eine multimodale Mix-of-Experts-Architektur mit fotorealistischer Detailgenauigkeit und starker mehrsprachiger Textwiedergabe.

8,3B-Parameter-Videomodell mit nativer 720p-Ausgabe (hochskalierbar auf 1080p), starker Bewegungskohärenz und bilingualem Prompt-Verständnis bis zu 10 Sekunden.

Autoregressives Framework auf dem Janus Pro 7B-Modell, das multimodales Verständnis und Bilderzeugung in einer Architektur vereint.

Videomodelle im Standard- oder Pro-Modus mit Text-zu-Video, Bild-zu-Video, Referenz-zu-Video, Schnitt, nativem Ton und Mehrszenen-Übergängen.

Kling 3.0 Modell, das Bewegung von einem Referenzvideo auf eine Figur aus einem Referenzbild überträgt, mit Standard-720p- und Pro 1080p-Stufen.

Iterative KI-Suche, die immer wieder Anfragen anbietet, wenn die ersten Ergebnisse unzureichend sind, und liefert umfassendere Antworten als der Standardmodus.

KI-gestützte Websuche mit detaillierten Übersichten und Antworten, schneller als Deep Search. Rang #1 im OpenAI SimpleQA-Benchmark.

Kosteneffizientes Sprachmodell, das starke Argumentation und multimodale Leistung für allgemeine Produktionslasten bei wettbewerbsfähiger Latenz bietet.

Mistral AIVeröffentlicht 12. Aug. 2025Ctx 131KTextgenerierungEnterprise-Modell mit starkem Argument, Codierung und STEM-Leistung, unterstützt hybride, lokale und in-VPC-Implementierungen.

Mistral AIVeröffentlicht 17. März 2025Ctx 128KTextgenerierung24B-Parameter multimodales Modell mit 128K Kontext für Bildanalyse, Programmierung, Mathematik und mehrsprachige Aufgaben, abgestimmt auf effiziente lokale Inferenz.

Hybridmodell, das die Familien Instructing, Reasoning (Magistral) und Devstral vereint: 40 % kürzere Abschlusszeit und 3-facher Durchsatz im Vergleich zu Small 3.

OpenMOSSVeröffentlicht 29. Jan. 2026VideoerzeugungEin Open-Source-32B MoE-Foundation-Modell, das synchronisiertes Video und Audio in einem Inferenzschritt mit präziser Dual-Tower-Lippensynchronisation erzeugt.

Kostengünstiges multimodales Foundation-Modell für Text, Bilder und Video in einem 300K-Kontext (bis zu ~30 Minuten Video), optimiert auf Geschwindigkeit und Erschwinglichkeit.

Schnelles, kostengünstiges multimodales Denkmodell für Text, Bilder, Dokumente und Video in einem 1-Monat-Kontext (lange Dokumente und ~90-minütige Clips).

Nur textbasiertes Foundation-Modell optimiert für ultraniedrige Latenz und Kosten bei 128K Kontext. Stark für Zusammenfassung, Übersetzung und Chat mit 44% Cache-Rabatt.

Das fähigste Modell der Familie. Multimodale text/image/Video in einem 1-Millionen-Kontext mit chain-of-thought Argumentation über Werkzeuge und Datenquellen hinweg.

Multimodales Foundation-Modell balanciert Genauigkeit, Geschwindigkeit und Kosten für Text, Bilder und Video auf 300K-Kontext (bis zu ~30 Minuten Video).

Whisper-1 speech-to-text Transkription, die auf mehrsprachiges, überwachtem Audio trainiert wurde, mit einem Upload-Limit von 25 MB pro Datei.

Institutionelle Forschung, gestützt auf Claude-Opus-4.6-Argumentation, mit maximaler Tiefe, erweitertem Werkzeugzugang und umfangreicher Quellenabdeckung.

Forschungsmodell für mehrstufige Abfindung, Synthese und Schlussfolgerung, bei dem Quellen über komplexe Themen hinweg autonom gesucht, gelesen und bewertet werden.

Sonar Pro als Agentic Researcher: Verkettet Websuchanfragen, ruft ganze Seiten ab und streamt Live-Argumentation, indem es die Strategie für komplexe Anfragen anpasst.

Echtzeit-Websuche mit Filterung nach Domain, Sprache, Datum und mehr. Liefert Suchergebnisse, keine LLM-Antworten; Keine Datei-Uploads.

Echtzeit-webverbundene Suche mit präzisen Zitaten und anpassbaren Quellen für up-to-date KI-Suchintegration in Produktionsanwendungen.

Suchbasiertes Modell mit doppelter Anzahl an Zitaten und einem größeren Kontextfenster, abgestimmt auf komplexe Anfragen, die tiefgehende, nuancierte Antworten erfordern.

Logikmodell auf dem unzensierten Open-Source-R1-1776 mit Websuche, das führende Suchmaschinen und LLMs im SimpleQA-Benchmark übertrifft.

Filmische Videoerzeugung in Text-zu-Video-, Bild-zu-Video- und Übergangsmodi mit hoher Detailgenauigkeit, flüssiger Bewegung und lebensechten Animationen.

Erzeugt Videos aus Text oder 1–2-Bilder-Bildprompts bis 1080p, mehrere Seitenverhältnisse, 5–10 Sekunden Dauer, optional synchronisiertes Audio.

Vereinheitlichtes Bildgenerierungs- und Bearbeitungsmodell mit klassenführender komplexer Chinese/English Textrendering, realistischen Texturen und Multi-Bild-Fusion.

Alibaba CloudSingaporeVeröffentlicht 21. Juli 2026BilderzeugungQwen-Bildgenerierung und -bearbeitung mit Base- und Pro-Varianten, mehrsprachiger Typografie, mehrfachen Bildreferenzen und steuerbarer 1K- oder 2K-Ausgabe.

Alibaba CloudSingaporeVeröffentlicht 24. Feb. 2026Ctx 1MTextgenerierungVision-Sprachmodell mit hybrider linearer Aufmerksamkeit plus spärlicher MoE, 1M-Kontext und schneller multimodaler text/image-/Videoinferenz.

Alibaba CloudChinaVeröffentlicht 24. Feb. 2026Ctx 1MTextgenerierungVision-Sprachmodell mit hybrider linearer Aufmerksamkeit plus spärlicher MoE, 1M-Kontext und schneller multimodaler text/image-/Videoinferenz.

Alibaba CloudSingaporeVeröffentlicht 30. März 2026Ctx 256KTextgenerierungKosteneffizientes omnimodales Modell verarbeitet Text, Bild, Audio und Video, mit bis zu 3 Stunden Audio und 1 Stunde Video in 90+ Sprachen.

Alibaba CloudSingaporeVeröffentlicht 30. März 2026Ctx 256KTextgenerierungFlaggschiff-Omnimodalmodell für Text, Bild, Audio und Video. 3h Audio, 1h Video, 90+ Ein- und 30+ Ausgabesprachen, 55 Sprachtimbre.

Alibaba CloudSingaporeVeröffentlicht 16. Feb. 2026Ctx 1MTextgenerierungMultimodales Modell mit hybrider Architektur für effizientes tiefes Denken und visuelles Verständnis über Text, Bild und Video in einem 1-Monats-Kontext.

Alibaba CloudChinaVeröffentlicht 16. Feb. 2026Ctx 1MTextgenerierungMultimodales Modell mit hybrider Architektur für effizientes tiefes Denken und visuelles Verständnis über Text, Bild und Video in einem 1-Monats-Kontext.

Alibaba CloudSingaporeVeröffentlicht 20. Apr. 2026Ctx 256KTextgenerierungGrößte Vorschauvariante der 3.6-Serie (nur Text): verbesserte Ausführung von Coding-Agenten, stärkere Frontend-Fähigkeiten und breiteres Long-Tail-Wissen.

Alibaba CloudSingaporeVeröffentlicht 2. Apr. 2026Ctx 1MTextgenerierungVision-Sprachmodell mit wesentlichen Verbesserungen gegenüber 3.5: agentisches und Frontend-Coding, multimodale Erkennung, OCR und Objektlokalisierung.

Alibaba CloudChinaVeröffentlicht 2. Apr. 2026Ctx 1MTextgenerierungVision-Sprachmodell mit wesentlichen Verbesserungen gegenüber 3.5: agentisches und Frontend-Coding, multimodale Erkennung, OCR und Objektlokalisierung.

Alibaba CloudSingaporeVeröffentlicht 23. Sept. 2025Ctx 256KTextgenerierung256K-Kontext-Flaggschiff mit wesentlichen Verbesserungen bei Argumentation, Anleitung und mehrsprachiger Unterstützung sowie höherer coding/math Genauigkeit.

Alibaba CloudSingaporeVeröffentlicht 5. Sept. 2025Ctx 256KTextgenerierungPreview Release mit großen Vorteilen gegenüber der 2.5-Serie in chinesisch-englischem Verständnis, komplexen Anweisungen, mehrsprachigen Fähigkeiten und Werkzeuggebrauch.

Alibaba CloudSingaporeVeröffentlicht 23. Sept. 2025Ctx 256KTextgenerierungArgumentationsmodell mit adaptivem Werkzeugeinsatz (Such-, Speicher-, Code-Interpreter) und Testzeit-Skalierung für höhere Genauigkeit bei komplexen Aufgaben.

Semantischer Dokumenten-Reranker. Sortiert bis zu 500 Kandidaten pro Abfrage nach Relevanz, unterstützt über 100 Sprachen und akzeptiert eine benutzerdefinierte Sortieranweisung.

ByteDanceMalaysiaVeröffentlicht 14. Feb. 2026Ctx 256KTextgenerierungCoding-tuned 256K-Kontextmodell mit starken Frontend-Ergebnissen und mehrsprachiger Programmierunterstützung für KI-Codierungstools und -Agenten.

ByteDanceMalaysiaVeröffentlicht 14. Feb. 2026Ctx 256KTextgenerierungAusgewogenes Allzweckmodell für hochfrequente Enterprise-Workloads: Informationsverarbeitung, Inhalt, Suche und Datenanalyse.

ByteDanceMalaysiaVeröffentlicht 14. Feb. 2026Ctx 256KTextgenerierungLatenzorientiertes multimodales Modell mit 256K-Kontext, vier logischen Aufwandsmodi und image/video Verständnis für die Nutzung hoher Währungen.

ByteDanceMalaysiaVeröffentlicht 14. Feb. 2026Ctx 256KTextgenerierungFlaggschiff-Gesamtmodell mit 256K-Kontext für komplexes Denken, multimodales Verständnis, strukturierte Generierung und tool-erweiterte Ausführung.

Geschwindigkeitsoptimierte 2.0 Videovariante für filmische Clips mit nativer Audio-Synchronisation, Kamerasteuerung und stabiler Bewegung zu geringeren Kosten pro Render.

Multimodales Videomodell für die filmische Ausgabe von Text-, Bild-, Audio- oder Videoeingängen mit stabiler Bewegung und konsistenten Zeichen.

Einheitliches multimodales Bildmodell, das durch Eingabeaufforderungen vor dem Rendern begründet und hochauflösende und konsistente Bearbeitungen und Markenvisuals erzeugt.

Premium-Seedream-Bildmodell für text-to-image, Bearbeitungen und Multireferenz-Fusion mit 1K-, 1,5K- und 2K-Ausgaben plus Standard- oder Fast-Prompt-Optimierung.

Open-Source-Voice-Modell für Long-Form, Multi-Speaker-Podcast-Dialog mit paralinguistischer Steuerung (Lachen, Seufzen) und Zero-Shot-Voice-Klonen.

Erzeugt Audio bis zu 3 Minuten aus Textaufforderungen und unterstützt text-to-audio und audio-to-audio mit einstellbarer Dauer, Schritten und CFG-Skala.

Up to-3-minute Audio aus Text mit text-to-audio, audio-to-audio und Audio-Inpainting für Musikproduktion, Sounddesign und Remixing.

VITA-Group / EPFLVeröffentlicht 26. Dez. 2025VideoerzeugungStable Video Infinity 2.0 Pro auf WAN 2.2: Erweitert Standbilder in theoretisch unendlich lange Videos unter Beibehaltung konsistenter Zeichen-IDs.

Multi-search research assistant, der ein thema erforscht, quellen analysiert und einen detaillierten forschungsbericht mit zitaten erstellt.

Web-Suche mit Crawl, Extrahieren und URL-Mapping für schnelles, strukturiertes Abrufen über Seiten und Domains für nachgelagerte Pipelines.

Alibaba CloudSingaporeVeröffentlicht 4. Juni 2025Ctx 8KEinbettungenMehrsprachige Texteinbettung mit wählbaren Ausgabedimensionen (64-2048). Bis zu 8.192 Token pro Eingang.

Alibaba CloudSingaporeVeröffentlicht 23. Sept. 2025Ctx 1KEinbettungenGeschwindigkeitsoptimierte multimodale Einbettung - die gleiche Form wie Vision-Plus, 3x billigere image/video Token.

Alibaba CloudSingaporeVeröffentlicht 23. Sept. 2025Ctx 1KEinbettungenMultimodale Einbettung, die unabhängige Vektoren für Text-, Bild- und Videoeingaben erzeugt.

Multimodales Video-Generierungsmodell für filmische Multi-Shot-Stories mit nativer audio-visueller Synchronisierung (Lip-Sync, Dialog, Musik, SFX).

Multimodales Videomodell, das T2V, I2V, Videobearbeitung und reference-to-video unterstützt, mit High-Fidelity-Ausgabe von Text-, Bild- oder Videoeingängen.

Bildgenerierung und -bearbeitung Begleitmodell: text-to-image, Bounding-Box-Bearbeitungen und zusammenhängende Bildsätze mit bis zu 4K-Ausgabe auf Pro.

Kontrollierte Whisper Large v3 Turbo-Transkription mit mehrsprachigem ASR, Übersetzung, VAD, Zeitstempeln, Untertiteln, Hotwords und Decoder-Steuerungen.

Autonomer KI-Agent, der eine hochrangige Eingabeaufforderung in Unteraufgaben umwandelt, Werkzeuge und APIs aufruft und end-to-end Ergebnisse ohne manuelle Orchestrierung liefert.

Text-zu-Video, image-to-video und reference-to-video Generation mit bis zu sieben Referenzbildern für konsistente Zeichen, bis zu 15 Sekunden bei 1080p.

Top-Tier-Modell für agentische Workflows, komplexe Softwareentwicklung und langfristige Aufgaben, das Arbeit über 1000+ Werkzeugaufrufe auf 1 Million Kontext unterstützt.

Multimodales Modell mit nativem visuellen und akustischen Verständnis in einem 1-Millionen-Kontext, entwickelt für das Denken und Handeln über verschiedene Modalitäten hinweg in agentischen Workflows.

Alibaba CloudSingaporeVeröffentlicht 22. Juni 2026VideoerzeugungText, Bild und reference-to-video in einem Modell. Filmische Bewegung, Charakterkonsistenz über bis zu 9 Referenzen hinweg und synchronisierte native Audioaufnahmen.

Die schnellste und günstigste Seedance 2.0-Stufe für kurze filmische Clips mit nativem Audio, Kamerasteuerung sowie Bild- oder Videoeingängen in 480p und 720p.

StepFunInternationalVeröffentlicht 28. Mai 2026Ctx 256KTextgenerierungStepFun multimodales Denkmodell mit Bild- und Videoeingabe, Werkzeugaufruf, anpassbarem Schlussfolgeraufwand und 256K-Kontext.

StepFunInternationalVeröffentlicht 12. Feb. 2026Ctx 256KTextgenerierungStepFun Text-Reasoning-Modell für Agenten, Programmierung, Werkzeugaufrufe und Langkontextanalyse.

StepFunInternationalVeröffentlicht 2. Apr. 2026Ctx 256KTextgenerierungAgentenoptimierte Step 3.5 Flash-Variante mit niedrigen und hohen Denkaufwand-Modi.

StepFun Audio- und Textgesprächsmodell mit Textausgabe und paralinguistischem Verständnis.

StepFunInternationalVeröffentlicht 29. Apr. 2026BilderzeugungStepFun-Bildgenerierungs- und Bildbearbeitungsmodell für text-to-image- und Einzelbildbearbeitungen.

StepFunInternationalVeröffentlicht 21. Apr. 2026AudiogenerationContextual StepFun text-to-speech Modell mit natürlicher Sprachrichtung und expressiver Darbietung.

StepFun text-to-speech Modell mit offiziellen Stimmen, individuell geklonten Stimmen und Stimmtag-Steuerung.

StepFunInternationalVeröffentlicht 24. Apr. 2026TranskriptionStepFun Streaming-Spracherkennungsmodell für chinesische und englische Audiotranskription.

ByteDanceMalaysiaVeröffentlicht 13. Juli 2026Ctx 256KTextgenerierungCodierung und Agentenmodell der nächsten Generation mit technischer Codelieferung, langfristiger Autonomie und 256K-Multimodalem Verständnis.

Alibaba CloudSingaporeVeröffentlicht 20. Juli 2026AudiogenerationGestufte Sprachsynthese mit über 1.000 Stimmen, 16 Sprachen, 20 chinesischen Dialekten, natürlichsprachlicher Sprechrichtung und Inline-Emotions-Tags.

Erzeugt 4- bis 15-sekündige Clips mit bis zu 2K und nativem Stereo-Audio und folgt Text-, Bild-, Video- und Audioreferenzen in einer Anfrage.

OpenAIs Flaggschiff-Bildmodell mit hoher Prompt-Genauigkeit, klarer Textwiedergabe und instruktionsbasierter Bearbeitung über bis zu 16 Referenzbilder hinweg.

Kuaishous Kling 3.0 Videogenerator mit text-to-video, erster und letzter Frame image-to-video, nativem Audio und 720p, 1080p oder 4K-Ausgang.

Alibabas Wan 2.5 Videomodell mit text-to-video und image-to-video, nativem Audio, optionalen benutzerdefinierten Audiospuren und 480p bis 1080p Ausgang.

Alibabas Wan 2.2 Videofamilie mit Standard- und Flash-Tiers, erster und letzter Bild-Interpolation sowie 480p-zu-1080p-Ausgabe zu niedrigen Kosten.

Alibabas Wan 2.1 Videomodell mit Turbo und Plus-Tiers für text-to-video, image-to-video sowie erste und letzte Frame-Clips in 480p oder 720p.

Alibabas Wan 2.5 Bildmodell mit text-to-image und Multireferenzbearbeitung von bis zu 3 Bildern bei etwa 1,7 Megapixeln.

Alibabas Wan 2.2 text-to-image Modell mit Plus- und Flash-Stufen sowie bis zu 1440x1440 Ausgaben zu niedrigen Preisen pro Bild.

Alibabas Wan 2.1 text-to-image Modell mit Turbo- und Plus-Tiers sowie bis zu 1440x1440 Ausgabe zu niedrigen Pro-Bild-Preisen.

Langformiges Videomodell für kohärente Clips bis zu 30 Sekunden, mit bis zu 50 Referenzbildern, Videos und Audioclips, nativem Audio, Schnitt und Erweiterung.
140 / 155 Modelle