
Text-zu-Video und image-to-video mit synchronisiertem nativem Audio, bei 720p oder 1080p für 3 bis 15 Sekunden, mit Seitenverhältnis und sofortiger Steuerung.
Bezahle nur für das, was du benutzt. Keine Abo-Sperrungen.
Preiskatalog
Die Preise von EmpirioLabs variieren je nach Modell und Einheit: Tokens, Bilder, Sekunden Audio oder Video, Nachrichten, 3D-Assets und Suchanfragen. Die interaktive Preistabelle lädt den aktuellen Katalog, während diese repräsentativen Preise ohne Client-JavaScript lesbar bleiben.
Bildeingabe $0.05 pro Bild. Die Videoausgabe beginnt mit $0.096 pro Sekunde für 480p und $0.168 pro Sekunde für 720p.
Die Eingabe beginnt bei $0.40 pro 1 Million Prompt-Tokens für eine kosteneffiziente multimodale API mit langem Kontext.
Die Eingabe beginnt bei $0.30 pro 1 Million Prompt-Tokens für multimodales Denken, Codieren und Agenten-Workloads.
Die Bild-zu-3D-Generierung wird pro generiertem 3D-Asset bepreist, mit Dokumenten für Format- und Auflösungskontrollen.
Modell-API-Tarife werden in USD angezeigt und abgerechnet. Der Checkout kann lokale Zahlungsmethoden anzeigen, wenn sie verfügbar sind.

Text-zu-Video und image-to-video mit synchronisiertem nativem Audio, bei 720p oder 1080p für 3 bis 15 Sekunden, mit Seitenverhältnis und sofortiger Steuerung.

Reasoning- und Codierungsmodell mit einem 1M-Token-Kontext, 128K-Ausgabe, einstellbarem Argumentationsaufwand, nativer Websuche und Tool-Aufrufen.

Reasoning- und Codierungsmodell mit einem 1M-Token-Kontext, 128K-Ausgabe, einstellbarem Argumentationsaufwand, nativer Websuche und Tool-Aufrufen.

Moonshot AIInternationalVeröffentlicht 15. Juli 2026Ctx 1MTextgenerierungKimi K3 is Moonshot's flagship reasoning model with a 1M token context, always-on thinking, native web search, and text, image, and video inputs.

Moonshot AIInternationalVeröffentlicht 16. Juni 2026Ctx 256KTextgenerierungKimi K2.7 Code ist Moonshots Agentik-Codierungsmodell mit einem Trillion-Parameter-Parameter mit 256K-Kontext, ständiger Argumentation und Text-, Bild- und Videoeingaben.

Moonshot AIGermanyVeröffentlicht 16. Juni 2026Ctx 256KTextgenerierungKimi K2.7 Code ist Moonshots Agentik-Codierungsmodell mit einem Trillion-Parameter-Parameter mit 256K-Kontext, ständiger Argumentation und Text-, Bild- und Videoeingaben.

Meta-Frontier-Denkmodell mit einem 1M Token-Kontext, Bild- und Videoverständnis, integrierter Websuche mit zitierten Quellen und Werkzeugaufrufen.

Updated multi-agent conductor for hard reasoning, coding, and research, with distinct max effort, 1M context, image input, and web search.

Alibaba CloudSingaporeVeröffentlicht 1. Juni 2026Ctx 1MTextgenerierungKostengünstiges Qwen3.7 Vision-Sprachmodell für Text, Bild, Video, Codierung, Werkzeugnutzung, GUI-Verständnis und 1M-Kontext-Workflows.

Alibaba CloudChinaVeröffentlicht 1. Juni 2026Ctx 1MTextgenerierungKostengünstiges Qwen3.7 Vision-Sprachmodell für Text, Bild, Video, Codierung, Werkzeugnutzung, GUI-Verständnis und 1M-Kontext-Workflows.

Moonshot AIInternationalVeröffentlicht 16. Juni 2026Ctx 256KTextgenerierungKimi K2.7 Code Highspeed ist die schneller dienende Ebene des agentischen Codierungsmodells von Moonshot mit 256K Kontext, ständigem Denken und Bild- und Videoeingaben.

Original multi-agent conductor for hard reasoning, coding, and research, with 1M context, image input, function calling, and web search.

Alibaba CloudSingaporeVeröffentlicht 15. Juli 2026Ctx 1MTextgenerierungFast Qwen3.7 vision-language model for text, image, video, tool use, and agentic tasks, with implicit caching and a 1M token context.

Alibaba CloudChinaVeröffentlicht 15. Juli 2026Ctx 1MTextgenerierungFast Qwen3.7 vision-language model for text, image, video, tool use, and agentic tasks, with implicit caching and a 1M token context.

MiniMax M3 ist ein multimodales Argumentationsmodell für Codierung, Agenten und lange Kontextanalyse mit Text-, Bild- und Videoeingabe.

MiniMax M3 ist ein multimodales Argumentationsmodell für Codierung, Agenten und lange Kontextanalyse mit Text-, Bild- und Videoeingabe.

Alibaba CloudSingaporeVeröffentlicht 21. Mai 2026Ctx 1MTextgenerierungQwen3.7 Max ist ein Flaggschiff-Textmodell für Codierung, Produktivität, langjährige Agenten, tiefes Denken, Tools und 1M-Token-Kontext.

Alibaba CloudChinaVeröffentlicht 21. Mai 2026Ctx 1MTextgenerierungQwen3.7 Max ist ein Flaggschiff-Textmodell für Codierung, Produktivität, langjährige Agenten, tiefes Denken, Tools und 1M-Token-Kontext.

Open-Source-Musikgenerierungsmodell für text-to-song und lyrisch geführtes Audio, mit schneller 8-stufiger XL Turbo-Inferenz für eine steuerbare Song-Iteration.

Black Forest LabsVeröffentlicht 15. Jan. 2026BilderzeugungApache-lizenziert 4B FLUX.2 Kleines Bilderzeugungs- und Bearbeitungsmodell mit text-to-image, Referenzbildbearbeitung und kreativer Workflow-Unterstützung.

MiniMaxSingaporeVeröffentlicht 18. März 2026Ctx 200KTextgenerierungHigh-Speed-M2.7-Variante für schnelle Rückschlüsse mit starker Allzweckleistung mit starken agentischen Fähigkeiten.
Echtzeit-Sprachmodell mit einfacher englischer Sprachsteuerung, einer Sprachidentität in 100+ Sprachen und Streaming-time-to-first-audio unter 200 ms.

Sub-130ms TTFB Sprachsynthese mit 271+ Stimmen in 15 Sprachen, expressive Prosodie und Echtzeit-SSE-Streaming für Sprachagenten mit niedriger Latenz.
Sprachsynthese in Broadcast-Qualität mit reichhaltiger ausdrucksstarker Prosodie, 271+ Stimmen in 15 Sprachen und Echtzeit-SSE-Streaming mit Zeitstempeln pro Wort.

Langkontext-Zhipu AI-Abwägungsmodell mit 202K-Kontext, 128K-Ausgabe, Werkzeugaufruf, strukturierter Ausgabe und Cache-Unterstützung.

Kimi K2.6 ist ein Moonshot multimodales Argumentationsmodell mit 256K Kontext, starker Codierung und Text-, Bild- und Videoeingaben.

MiniMaxSingaporeVeröffentlicht 18. März 2026Ctx 200KTextgenerierungMinimax m2.7 ist ein universelles argumenting-chat-modell mit interleaved-denken, funktionsaufruf und promptem caching.
TRELLIS.2 Bild-zu-3D-Modell, das ein Referenzbild in ein strukturiertes GLB-Asset mit Auflösung, Seed, Mesh, Textur und Exportkontrollen verwandelt.

Alibaba CloudChinaVeröffentlicht 24. Feb. 2026Ctx 256KTextgenerierungQwen3.5 122B-A10B ist ein multimodales Argumentationsmodell mit 256K Kontext, effizienter spärlicher MoE-Inferenz sowie Text-, Bild- und Videoeingabe.

Alibaba CloudChinaVeröffentlicht 16. Feb. 2026Ctx 256KTextgenerierungQwen3.5 397B-A17B ist ein multimodales Leitmodell für Sprache, Code, Agenten, GUI-Aufgaben sowie Bild- und Videoverständnis.

Alibaba CloudChinaVeröffentlicht 24. Feb. 2026Ctx 256KTextgenerierungQwen3.5 35B-A3B ist ein effizientes natives Vision-Sprachmodell mit spärlichem MoE-Routing, tiefem Denken und Text-, Bild- und Videoeingaben.

Alibaba CloudChinaVeröffentlicht 24. Feb. 2026Ctx 256KTextgenerierungQwen3.5 27B ist ein dichtes multimodales Argumentationsmodell mit schnellen Antworten, 256K Kontext und Text-, Bild- und Videoverständnis.

Alibaba CloudChinaVeröffentlicht 22. Apr. 2026Ctx 256KTextgenerierungQwen3.6 27B verbessert Agentic Coding, STEM Reasoning, räumliches Sehen, OCR sowie Text-, Bild- und Videoverständnis im 256K Kontext.

Alibaba CloudSingaporeVeröffentlicht 16. Apr. 2026Ctx 1MTextgenerierungSchnelles Qwen3.6-Vision-Sprachmodell für agentische Codierung, mathematisches Denken, räumliches Verständnis, OCR sowie Text-, Bild- und Videoeingaben.

Alibaba CloudChinaVeröffentlicht 16. Apr. 2026Ctx 1MTextgenerierungSchnelles Qwen3.6-Vision-Sprachmodell für agentische Codierung, mathematisches Denken, räumliches Verständnis, OCR sowie Text-, Bild- und Videoeingaben.

GoogleVeröffentlicht 31. März 2026Ctx 256KTextgenerierungGemma 4 26B A4B ist ein offenes multimodales Google-Modell mit 256K Kontext-, Text-, Bild- und Videoeingaben, Tools und strukturierter Ausgabe.

Alibaba CloudVeröffentlicht 23. Feb. 2026Ctx 256KTextgenerierungQwen3.5 9B ist ein kompaktes multimodales Argumentationsmodell mit 256K Kontext, Bild- und Videoeingabe, Funktionswerkzeugen und strukturierter Ausgabe.

Alibaba CloudVeröffentlicht 2. März 2026Ctx 256KTextgenerierungQwen3.5 4B ist ein kostengünstiges multimodales Argumentationsmodell mit 256K Kontext, Bild- und Videoeingabe, Funktionswerkzeugen und strukturierter Ausgabe.

Alibaba CloudVeröffentlicht 29. Juli 2026Ctx 128KTextgenerierungQwen3.6 35B A3B is a 256-expert mixture-of-experts reasoning model with 128K context, function tools, and strict structured JSON output.

Z.aiSingaporeVeröffentlicht 19. Jan. 2026Ctx 200KTextgenerierungKostenloses, leichtes GLM-4.7-Textmodell für Codierung, Argumentation, Langkontextschreiben und allgemeinen Chat.

Z.aiSingaporeVeröffentlicht 28. Juli 2025Ctx 200KTextgenerierungKostenloses, leichtes GLM-4.5-Textmodell für Argumentation, Codierung, Langform-Chat und allgemeine Sprachaufgaben.

Z.aiSingaporeVeröffentlicht 8. Dez. 2025Ctx 128KTextgenerierungKostenloses multimodales GLM-4.6V Modell für Bild-, Video-, Datei- und Textverständnis mit nativem Funktionsaufruf.

Bilderzeugung und -bearbeitungsmodell Erstellen und Ändern von Bildern aus Text- oder Bildeingaben mit Inpainting, virtuellen Try-On- und Style-Steuerelementen.

Videogenerierungsmodell, das bis zu 2-minütige Multi-Shot-Videos aus Text- und optionalen Bildaufforderungen mit verbesserter Qualität und Konsistenz produziert.

Sprach-zu-Text-Transkription mit dem Nova-3-Modell mit mehrsprachiger Unterstützung und erweiterten anpassbaren Einstellungen für Produktions-Workloads.

Pairs DeepSeek R1 chain-of-thought Argumentation mit Anthropic Claude Creative und Code-Generierung hinter einer einheitlichen, datengesteuerten Schnittstelle.

Open-Source LLM spezialisierte sich auf formale Theoremprüfung in Lean 4, basierend auf einer rekursiven Theorem-proving Pipeline.

DeepSeekSingaporeVeröffentlicht 1. Dez. 2025Ctx 128KTextgenerierungOpen-Source Mixture-of-Experts LLM war auf hocheffizientes Denken, Codieren und allgemeine Sprachaufgaben in langen Aufforderungen ausgerichtet.

DeepSeekGermanyVeröffentlicht 24. Apr. 2026Ctx 1MTextgenerierungLeichtes MoE-Modell mit 284B insgesamt / 13B aktiven Parametern und nativem 1M-Kontext, abgestimmt auf eine kostengünstige Nutzung mit niedriger Latenz.

DeepSeekSingaporeVeröffentlicht 24. Apr. 2026Ctx 1MTextgenerierungLeichtes MoE-Modell mit 284B insgesamt / 13B aktiven Parametern und nativem 1M-Kontext, abgestimmt auf eine kostengünstige Nutzung mit niedriger Latenz.

DeepSeekChinaVeröffentlicht 24. Apr. 2026Ctx 1MTextgenerierungLeichtes MoE-Modell mit 284B insgesamt / 13B aktiven Parametern und nativem 1M-Kontext, abgestimmt auf eine kostengünstige Nutzung mit niedriger Latenz.

DeepSeekGermanyVeröffentlicht 24. Apr. 2026Ctx 1MTextgenerierungFlaggschiff MoE LLM mit 1,6T insgesamt / 49B aktiven Parametern und nativem 1M-Kontext für fortgeschrittene Mathematik, logische Inferenz und spezialisierte Codierung.

DeepSeekSingaporeVeröffentlicht 24. Apr. 2026Ctx 1MTextgenerierungFlaggschiff MoE LLM mit 1,6T insgesamt / 49B aktiven Parametern und nativem 1M-Kontext für fortgeschrittene Mathematik, logische Inferenz und spezialisierte Codierung.

DeepSeekChinaVeröffentlicht 24. Apr. 2026Ctx 1MTextgenerierungFlaggschiff MoE LLM mit 1,6T insgesamt / 49B aktiven Parametern und nativem 1M-Kontext für fortgeschrittene Mathematik, logische Inferenz und spezialisierte Codierung.

Schnelle Antwort im LLM-Stil auf eine Frage in natürlicher Sprache, die auf frischen Exa-Websuchergebnissen mit Inline-Zitaten und Quelllinks basiert.

Web-Suchmaschine zum Finden von Seiten, zum Abrufen ähnlicher Seiten, zum Crawlen und zur dedizierten Codesuche im offenen Web für KI-Agenten.

Niedrige Latenz text-to-speech mit Single- und Multi-Sprecher-Stimmen und steuerbarem Stil, Akzent und ausdrucksstarken Ton für Produktions-Apps.

Hochwertige TTS-Vorschau für Podcasts, Hörbücher und Kundensupport mit ausdrucksstarken Multi-Sprecher-Stimmen in 23+ Sprachen.

Hoch kontrollierbare TTS mit neuen Audio-Tags für präzisen Stil, Ton, Tempo und Lieferung über Narration, Assistenten und Voice-Apps.

Open-Source Vision-Sprachmodell mit 128K Kontext, 140+ Sprachen, verbesserte math/reasoning, strukturierte Ausgaben und Funktionsaufrufe.

LLM-basiertes text-to-speech mit Zero-Shot-Sprachklonen aus 3-10 Audio- und emotionsexpressiver, steuerbarer Ausgabe über Multi-Reward RL.

Deep-Learning-Detektor, der Textteile markiert, die wahrscheinlich von KI gegen Menschen generiert werden, und den Inhalt als vollständig menschlich, KI oder gemischt klassifiziert.

Video-Modell bietet Text-to-Video, Image-to-Video, Reference-to-Video und Video Edit-Modi mit High-Fidelity, Motion-Smooth-Ausgabe.

Open-Source-Modell text-to-image auf einer multimodalen Mixture-of-Experts-Architektur mit fotorealistischen Details und starker mehrsprachiger Textwiedergabe.

8.3B-Parameter-Videomodell mit nativem 720p-Ausgang (upskalierbar auf 1080p), starker Bewegungskohärenz und zweisprachigem promptem Verständnis bis zu 10s.

Autoregressives Framework auf dem Janus Pro 7B-Modell, das multimodales Verständnis und Bilderzeugung in einer Architektur vereint.

Videomodell im Standard- oder Pro-Modus mit Text-zu-Video, Bild-zu-Video, Referenz-zu-Video, Bearbeitung, nativem Sound und Multi-Szenen-Übergängen.

Kling 3.0-Modell, das Bewegung von einem Referenzvideo auf einen Charakter aus einem Referenzbild überträgt, mit Standard 720p und Pro 1080p Ebenen.

Iterative KI-Suche, die immer dann abfragt, wenn die ersten Ergebnisse unzureichend sind, und umfassendere Antworten liefert als der Standardmodus.

KI-gestützte Websuche mit detaillierten Übersichten und Antworten, schneller als Deep Search. Rang 1 auf OpenAI SimpleQA Benchmark.

Kosteneffizientes Sprachmodell mit starker Argumentation und multimodaler Leistung für allgemeine Produktionsauslastungen bei wettbewerbsfähiger Latenz.

Mistral AIVeröffentlicht 12. Aug. 2025Ctx 131KTextgenerierungEnterprise-Grade-Modell mit starker Argumentation, Codierung und STEM-Leistung, unterstützt Hybrid-, On-Prem- und In-VPC-Bereitstellungen.

Mistral AIVeröffentlicht 17. März 2025Ctx 128KTextgenerierungMultimodales 24B-Parameter-Modell mit 128K-Kontext für Bildanalyse, Programmierung, Mathematik und mehrsprachige Aufgaben, abgestimmt auf effiziente lokale Inferenz.

Hybridmodell vereint Instruct, Reasoning (Magistral) und Devstral-Familien: 40% geringere Fertigstellungszeit und 3x Durchsatz gegenüber Small 3.

OpenMOSSVeröffentlicht 29. Jan. 2026VideoerzeugungOpen-Source 32B MoE-Basismodell, das synchronisiertes Video und Audio in einem Inferenzschritt mit präziser Doppelturm-Lippensynchronisation erzeugt.

Kostengünstiges multimodales Basismodell für Text, Bilder und Videos in einem 300K-Kontext (bis zu ca. 30 min Video), abgestimmt auf Geschwindigkeit und Erschwinglichkeit.

Schnelles, kostengünstiges multimodales Argumentationsmodell für Text, Bilder, Dokumente und Videos in einem 1M-Kontext (lange Dokumente und ca. 90 min Clips).

Text-only-Basismodell für ultra-niedrige Latenz und Kosten im 128K-Kontext. Stark für Zusammenfassung, Übersetzung und Chat mit 44% Cache-Rabatt.

Das fähigste Modell in der Familie. Multimodales text/image /Video im 1M-Kontext mit chain-of-thought Argumentation über Tools und Datenquellen hinweg.

Multimodales Fundamentmodell balanciert Genauigkeit, Geschwindigkeit und Kosten für Text, Bilder und Videos im 300K-Kontext (bis zu ca. 30 min Video).

Whisper-1 speech-to-text Transkription mit einem Upload-Limit von 25 MB pro Datei.

Institutionelle Forschung, angetrieben von Claude Opus 4.6, mit maximaler Tiefe, verbessertem Werkzeugzugriff und umfangreicher Quellenabdeckung.

Forschungsmodell für mehrstufiges Abrufen, Synthese und Argumentieren, autonomes Suchen, Lesen und Auswerten von Quellen zu komplexen Themen.

Sonar Pro als Agentic Researcher: Ketten Web-Suchen, holt ganze Seiten und streamt Live-Denken, Anpassung der Strategie für komplexe Abfragen.

Echtzeit-Websuche mit Filterung nach Domain, Sprache, Datum und mehr. Gibt Suchergebnisse zurück, keine LLM-Antworten; keine Datei-Uploads.

Echtzeit-Web-Suche mit genauen Zitaten und anpassbaren Quellen für up-to-date AI-Suchintegration in Produktions-Apps.

Suchbasiertes Modell mit doppelten Zitaten und einem größeren Kontextfenster, abgestimmt auf komplexe Abfragen, die detaillierte, nuancierte Antworten erfordern.

Das Argumentationsmodell des unzensierten Open-Source-R1-1776 mit Web-Suche übertraf führende Suchmaschinen und LLMs im SimpleQA-Benchmark.

Cinematic Video Generation in Text-to-Video, Image-to-Video und Übergangsmodi mit hohen Details, flüssiger Bewegung und lebensechten Animationen.

Generiert Videos aus Text- oder 1-2-Frame-Bildaufforderungen bis zu 1080p, mehreren Seitenverhältnissen, 5-10s Dauer mit optional synchronisiertem Audio.

Einheitliches Bilderzeugungs- und Bearbeitungsmodell mit klassenführendem komplexem Chinese/English Text-Rendering, realistischen Texturen und Multi-Bild-Fusion.

Alibaba CloudSingaporeVeröffentlicht 24. Feb. 2026Ctx 1MTextgenerierungVision-Sprachmodell mit hybrider linearer Aufmerksamkeit plus spärlichem MoE, 1M-Kontext und schneller multimodaler text/image /Video-Inferenz.

Alibaba CloudChinaVeröffentlicht 24. Feb. 2026Ctx 1MTextgenerierungVision-Sprachmodell mit hybrider linearer Aufmerksamkeit plus spärlichem MoE, 1M-Kontext und schneller multimodaler text/image /Video-Inferenz.

Alibaba CloudSingaporeVeröffentlicht 30. März 2026Ctx 256KTextgenerierungKosteneffizientes omnimodales Modell zur Bearbeitung von Text, Bild, Audio und Video mit bis zu 3 Stunden Audio und 1 Stunde Video in über 90 Sprachen.

Alibaba CloudSingaporeVeröffentlicht 30. März 2026Ctx 256KTextgenerierungFlaggschiff omnimodales Modell für Text, Bild, Audio und Video. 3h Audio, 1h Video, 90+ Eingangs- und 30+ Ausgangssprachen, 55 Stimmtöne.

Alibaba CloudSingaporeVeröffentlicht 16. Feb. 2026Ctx 1MTextgenerierungMultimodales Modell mit hybrider Architektur für effizientes tiefes Denken und visuelles Verständnis in Text, Bild und Video in einem 1M-Kontext.

Alibaba CloudChinaVeröffentlicht 16. Feb. 2026Ctx 1MTextgenerierungMultimodales Modell mit hybrider Architektur für effizientes tiefes Denken und visuelles Verständnis in Text, Bild und Video in einem 1M-Kontext.

Alibaba CloudSingaporeVeröffentlicht 20. Apr. 2026Ctx 256KTextgenerierungGrößte Vorschauvariante in der 3.6-Serie (nur Text): verbesserte Ausführung von Codierungsagenten, stärkere Front-End-Fähigkeiten und breiteres Long-Tail-Wissen.

Alibaba CloudSingaporeVeröffentlicht 2. Apr. 2026Ctx 1MTextgenerierungVision-Sprachmodell mit größeren Upgrades über 3.5: Agentische und Front-End-Codierung, multimodale Erkennung, OCR und Objektlokalisierung.

Alibaba CloudChinaVeröffentlicht 2. Apr. 2026Ctx 1MTextgenerierungVision-Sprachmodell mit größeren Upgrades über 3.5: Agentische und Front-End-Codierung, multimodale Erkennung, OCR und Objektlokalisierung.

Alibaba CloudSingaporeVeröffentlicht 23. Sept. 2025Ctx 256KTextgenerierung256K-Kontext-Flaggschiff mit wesentlichen Verbesserungen bei Argumentation, Anleitung und mehrsprachiger Unterstützung sowie höherer coding/math Genauigkeit.

Alibaba CloudSingaporeVeröffentlicht 5. Sept. 2025Ctx 256KTextgenerierungPreview Release mit großen Vorteilen gegenüber der 2.5-Serie in chinesisch-englischem Verständnis, komplexen Anweisungen, mehrsprachigen Fähigkeiten und Werkzeuggebrauch.

Alibaba CloudSingaporeVeröffentlicht 23. Sept. 2025Ctx 256KTextgenerierungArgumentationsmodell mit adaptivem Werkzeugeinsatz (Such-, Speicher-, Code-Interpreter) und Testzeit-Skalierung für höhere Genauigkeit bei komplexen Aufgaben.

Alibaba CloudSingaporeVeröffentlicht 5. Juni 2025Ctx 4000RanglistenSemantischer Dokumenten-Reranker. Sortiert bis zu 500 Kandidaten pro Abfrage nach Relevanz, unterstützt über 100 Sprachen und akzeptiert eine benutzerdefinierte Sortieranweisung.

ByteDanceMalaysiaVeröffentlicht 14. Feb. 2026Ctx 256KTextgenerierungCoding-tuned 256K-Kontextmodell mit starken Frontend-Ergebnissen und mehrsprachiger Programmierunterstützung für KI-Codierungstools und -Agenten.

ByteDanceMalaysiaVeröffentlicht 14. Feb. 2026Ctx 256KTextgenerierungAusgewogenes Allzweckmodell für hochfrequente Enterprise-Workloads: Informationsverarbeitung, Inhalt, Suche und Datenanalyse.

ByteDanceMalaysiaVeröffentlicht 14. Feb. 2026Ctx 256KTextgenerierungLatenzorientiertes multimodales Modell mit 256K-Kontext, vier logischen Aufwandsmodi und image/video Verständnis für die Nutzung hoher Währungen.

ByteDanceMalaysiaVeröffentlicht 14. Feb. 2026Ctx 256KTextgenerierungFlaggschiff-Gesamtmodell mit 256K-Kontext für komplexes Denken, multimodales Verständnis, strukturierte Generierung und tool-erweiterte Ausführung.

Geschwindigkeitsoptimierte 2.0 Videovariante für filmische Clips mit nativer Audio-Synchronisation, Kamerasteuerung und stabiler Bewegung zu geringeren Kosten pro Render.

Multimodales Videomodell für die filmische Ausgabe von Text-, Bild-, Audio- oder Videoeingängen mit stabiler Bewegung und konsistenten Zeichen.

Einheitliches multimodales Bildmodell, das durch Eingabeaufforderungen vor dem Rendern begründet und hochauflösende und konsistente Bearbeitungen und Markenvisuals erzeugt.

Premium-Seedream-Bildmodell für detaillierte text-to-image, Einzelbildbearbeitungen und Multi-Referenz-Fusion mit 1K- und 2K-Ausgabe.

Open-Source-Voice-Modell für Long-Form, Multi-Speaker-Podcast-Dialog mit paralinguistischer Steuerung (Lachen, Seufzen) und Zero-Shot-Voice-Klonen.

Erzeugt Audio bis zu 3 Minuten aus Textaufforderungen und unterstützt text-to-audio und audio-to-audio mit einstellbarer Dauer, Schritten und CFG-Skala.

Up to-3-minute Audio aus Text mit text-to-audio, audio-to-audio und Audio-Inpainting für Musikproduktion, Sounddesign und Remixing.

VITA-Group / EPFLVeröffentlicht 26. Dez. 2025VideoerzeugungStable Video Infinity 2.0 Pro auf WAN 2.2: Erweitert Standbilder in theoretisch unendlich lange Videos unter Beibehaltung konsistenter Zeichen-IDs.

Multi-search research assistant, der ein thema erforscht, quellen analysiert und einen detaillierten forschungsbericht mit zitaten erstellt.

Web-Suche mit Crawl, Extrahieren und URL-Mapping für schnelles, strukturiertes Abrufen über Seiten und Domains für nachgelagerte Pipelines.

Alibaba CloudSingaporeVeröffentlicht 4. Juni 2025Ctx 8192EinbettungenMehrsprachige Texteinbettung mit wählbaren Ausgabedimensionen (64-2048). Bis zu 8.192 Token pro Eingang.

Alibaba CloudSingaporeVeröffentlicht 23. Sept. 2025Ctx 1024EinbettungenGeschwindigkeitsoptimierte multimodale Einbettung - die gleiche Form wie Vision-Plus, 3x billigere image/video Token.

Alibaba CloudSingaporeVeröffentlicht 23. Sept. 2025Ctx 1024EinbettungenMultimodale Einbettung, die unabhängige Vektoren für Text-, Bild- und Videoeingaben erzeugt.

Multimodales Video-Generierungsmodell für filmische Multi-Shot-Stories mit nativer audio-visueller Synchronisierung (Lip-Sync, Dialog, Musik, SFX).

Multimodales Videomodell, das T2V, I2V, Videobearbeitung und reference-to-video unterstützt, mit High-Fidelity-Ausgabe von Text-, Bild- oder Videoeingängen.

Bildgenerierung und -bearbeitung Begleitmodell: text-to-image, Bounding-Box-Bearbeitungen und zusammenhängende Bildsätze mit bis zu 4K-Ausgabe auf Pro.

Kontrollierte Whisper Large v3 Turbo-Transkription mit mehrsprachigem ASR, Übersetzung, VAD, Zeitstempeln, Untertiteln, Hotwords und Decoder-Steuerungen.

Autonomer KI-Agent, der eine hochrangige Eingabeaufforderung in Teilaufgaben umwandelt, Tools und APIs aufruft und end-to-end Ergebnisse ohne manuelle Orchestrierung liefert.

Bild-zu-Video-Modell, das ein Quellbild mit prompt geführter Bewegung animiert, bis zu 15 Sekunden bei 480p oder 720p über sieben Seitenverhältnisse.

Top-Tier-Modell für agentische Workflows, komplexe Software-Engineering und Long-Horizont-Aufgaben, Aufrechterhaltung der Arbeit über 1000+ Tool erfordert 1M Kontext.

Multimodales Modell mit nativem visuellem und Audioverständnis in einem 1M-Kontext, das entwickelt wurde, um in agentischen Workflows über Modalitäten hinweg zu argumentieren und zu handeln.

Alibaba CloudSingaporeVeröffentlicht 22. Juni 2026VideoerzeugungText, Bild und reference-to-video in einem Modell. Filmische Bewegung, Charakterkonsistenz über bis zu 9 Referenzen hinweg und synchronisierte native Audioaufnahmen.

Die schnellste und günstigste Seedance 2.0-Stufe für kurze filmische Clips mit nativem Audio, Kamerasteuerung sowie Bild- oder Videoeingängen in 480p und 720p.

StepFunInternationalVeröffentlicht 28. Mai 2026Ctx 256KTextgenerierungStepFun multimodales Denkmodell mit Bild- und Videoeingabe, Werkzeugaufruf, anpassbarem Schlussfolgeraufwand und 256K-Kontext.

StepFunInternationalVeröffentlicht 12. Feb. 2026Ctx 256KTextgenerierungStepFun Text-Reasoning-Modell für Agenten, Programmierung, Werkzeugaufrufe und Langkontextanalyse.

StepFunInternationalVeröffentlicht 2. Apr. 2026Ctx 256KTextgenerierungAgentenoptimierte Step 3.5 Flash-Variante mit niedrigen und hohen Denkaufwand-Modi.

StepFun Audio- und Textgesprächsmodell mit Textausgabe und paralinguistischem Verständnis.

StepFunInternationalVeröffentlicht 29. Apr. 2026BilderzeugungStepFun-Bildgenerierungs- und Bildbearbeitungsmodell für text-to-image- und Einzelbildbearbeitungen.

StepFunInternationalVeröffentlicht 21. Apr. 2026AudiogenerationContextual StepFun text-to-speech Modell mit natürlicher Sprachrichtung und expressiver Darbietung.

StepFun text-to-speech Modell mit offiziellen Stimmen, individuell geklonten Stimmen und Stimmtag-Steuerung.

StepFunInternationalVeröffentlicht 24. Apr. 2026TranskriptionStepFun Streaming-Spracherkennungsmodell für chinesische und englische Audiotranskription.

ByteDanceMalaysiaVeröffentlicht 13. Juli 2026Ctx 256KTextgenerierungNext-generation coding and agent model with engineering-grade code delivery, long-horizon autonomy, and 256K multimodal understanding.

Alibaba CloudSingaporeVeröffentlicht 20. Juli 2026AudiogenerationTiered speech synthesis with over 1,000 voices, 16 languages, 20 Chinese dialects, natural-language delivery direction, and inline emotion tags.
127 / 141 Modelle