
GLM 5.3
Z.aiCoding and agentic model with a 1M token context, 128K output, always-on reasoning at low, high, or max effort, native web search, and tool calling.
Durchstöbern Sie den vollständigen Katalog der Modelle in Text, Bild, Audio, Video, 3D und mehr.
Modellkatalog
Durchsuchen Sie Text-, Bild-, Video-, Audio-, 3D-, Such- und Agenten-Endpunkte mit pay-as-you-go Preisen. Der interaktive Katalog lädt die aktuelle Verfügbarkeit von EmpirioLabs, und diese Modelldokumentationen sind ohne Client-JavaScript crawlbar.
xAI image-to-video mit promptgesteuerter Bewegung, nativem Audio, 480p- oder 720p-Ausgabe und bis zu 15 Sekunden langen Clips.
Multimodale Videoerzeugung für filmische Clips aus Text-, Bild-, Audio- oder Videoeingängen.
Vereinheitlichte Bildgenerierung und -bearbeitung für hochauflösende kreative, Marken- und Produktvisuals.
Kosteneffizientes Vision-Language-Modell für Text, Bild, Video, Coding, Tools und 1M-Kontext-Workflows.
Flaggschiff-Langkontextmodell für Programmierung, Produktivität, langlaufende Agenten, tiefes Denken und Werkzeugnutzung.
Multimodales Schließen für Coding, Agenten, Langkontextanalyse sowie Text-, Bild- und Videoeingabe.
Moonshot-Multimodallogik mit starker Codierungsunterstützung, 256K-Kontext sowie Bild- und Videoeingaben.
Langkontext-Argumentation mit Werkzeugaufrufen, strukturierter Ausgabe, Cache-Unterstützung und 128K-Ausgabe.
Bild-zu-3D-Generierung, die ein Referenzbild in ein strukturiertes GLB-Asset verwandelt.

Z.aiCoding and agentic model with a 1M token context, 128K output, always-on reasoning at low, high, or max effort, native web search, and tool calling.

Alibaba CloudMultimodal reasoner with 256K context, image and video input, function tools, structured JSON, and thinking on by default.

MiniMaxGenerates complete stereo songs from lyrics and a style prompt, with duration, seed, and format controls up to 5 minutes.

DeepSeekOfficial 0813 Pro release with major gains across coding, repository work, tool use, and agent tasks, plus hybrid thinking and a 1M context window.
Text-to-image plus multi-reference editing with up to three source images, selectable quality tiers, and 1K or 2K output resolution.

Meta AIMeta-offenes 30B-Agentenmodell mit Bildverständnis, 128K-Kontext, Werkzeugaufrufen, strukturierter Ausgabe und kontrollierbarer Argumentationsstärke.

Z.aiCoding and agentic model with a 1M token context, 128K output, always-on reasoning at low, high, or max effort, native web search, and tool calling.

Z.aiLogik- und Codierungsmodell mit einem 1M Token-Kontext, 128K-Ausgabe, anpassbarem Schlussfolgerungsaufwand, nativer Websuche und Werkzeugaufrufen.

Moonshot AIKimi K3 ist Moonshots Flaggschiff-Logikmodell mit einem 1-Millionen-Token-Kontext, ständigem Denken, nativer Websuche sowie Text-, Bild- und Videoeingaben.

Meta AIMetas aktualisiertes Frontier-Reasoning-Modell mit einem Kontext von 1.048.576 Tokens, Bild-, Video-, Audio- und PDF-Verständnis, Websuche und Werkzeugaufrufen.

Moonshot AIKimi K2.7 Code ist Moonshots agentisches Codierungsmodell mit Billionen Parametern und 256K-Kontext, ständigem Denken sowie Text-, Bild- und Videoeingaben.

Meta AIMeta-Frontier-Denkmodell mit einem Kontext von 1.048.576 Tokens sowie Bild-, Video-, Audio- und PDF-Verständnis, Websuche und Werkzeugaufrufen.

Black Forest LabsApache-lizenziertes 4B FLUX.2 Klein-Bildgenerierungs- und Bearbeitungsmodell mit text-to-image, Referenzbildbearbeitung und kreativer Workflow-Unterstützung.

AmazonBildgenerierung und -bearbeitung Modelle, die Bilder aus Text oder Bildeingaben erstellt und modifiziert, mit Inpainting-, virtuellen Anprobierungs- und Stilsteuerungen.

TencentOpen-Source-text-to-image modelliert eine multimodale Mix-of-Experts-Architektur mit fotorealistischer Detailgenauigkeit und starker mehrsprachiger Textwiedergabe.

DeepSeekAutoregressives Framework auf dem Janus Pro 7B-Modell, das multimodales Verständnis und Bilderzeugung in einer Architektur vereint.

Alibaba CloudVereinheitlichtes Bildgenerierungs- und Bearbeitungsmodell mit klassenführender komplexer Chinese/English Textrendering, realistischen Texturen und Multi-Bild-Fusion.

Alibaba CloudQwen-Bildgenerierung und -bearbeitung mit Base- und Pro-Varianten, mehrsprachiger Typografie, mehrfachen Bildreferenzen und steuerbarer 1K- oder 2K-Ausgabe.

Kling AIText-zu-Video und image-to-video mit synchronisiertem nativem Audio, auf 720p oder 1080p für 3 bis 15 Sekunden, mit Seitenverhältnis und Prompt-Steuerung.

AmazonVideogenerierungsmodell, das bis zu 2-minütige Mehrfachaufnahme-Videos aus Text und optionalen Bildeingaben mit verbesserter Qualität und Konsistenz erzeugt.

Alibaba CloudDas Videomodell bietet Text-zu-Video-, Bild-zu-Video-, Referenz-zu-Video- und Videobearbeitungsmodi mit hochauflösender, bewegungsglatter Ausgabe.

Tencent8,3B-Parameter-Videomodell mit nativer 720p-Ausgabe (hochskalierbar auf 1080p), starker Bewegungskohärenz und bilingualem Prompt-Verständnis bis zu 10 Sekunden.

Kling AIVideomodelle im Standard- oder Pro-Modus mit Text-zu-Video, Bild-zu-Video, Referenz-zu-Video, Schnitt, nativem Ton und Mehrszenen-Übergängen.

Kling AIKling 3.0 Modell, das Bewegung von einem Referenzvideo auf eine Figur aus einem Referenzbild überträgt, mit Standard-720p- und Pro 1080p-Stufen.

ACE-StepOpen-Source-Musikgenerierungsmodell für text-to-song und textgesteuerte Audio, mit schneller 8-Stufe XL Turbo-Inferenz für steuerbare Song-Iteration.

InworldEchtzeit-Sprachmodell mit einfacher englischer Sprachsteuerung, einer Sprachidentität in 100+ Sprachen und Streaming-time-to-first-audio unter 200 ms.

InworldSub-130 ms TTFB-Sprachsynthese mit 271+ Stimmen in 15 Sprachen, expressive Prosodie und Echtzeit-SSE-Streaming für Voice-Agents mit niedriger Latenz.

InworldBroadcast-Qualitäts-Stimmsynthese mit reichhaltiger expressiver Prosodie, 271+ Stimmen in 15 Sprachen und Echtzeit-SSE-Streaming mit Zeitstempeln pro Wort.

MiniMaxGenerates complete stereo songs from lyrics and a style prompt, with duration, seed, and format controls up to 5 minutes.

GoogleLatenzarte text-to-speech mit Ein- und Mehrlautsprecherstimmen sowie steuerbarem Stil, Akzent und ausdrucksstarkem Klang für Produktions-Apps.

DeepgramSprach-zu-Text-Transkription mit dem Nova-3-Modell mit mehrsprachiger Unterstützung und fortschrittlichen anpassbaren Einstellungen für Produktionsarbeitslasten.

OpenAIWhisper-1 speech-to-text Transkription, die auf mehrsprachiges, überwachtem Audio trainiert wurde, mit einem Upload-Limit von 25 MB pro Datei.

OpenAIKontrollierte Whisper Large v3 Turbo-Transkription mit mehrsprachigem ASR, Übersetzung, VAD, Zeitstempeln, Untertiteln, Hotwords und Decoder-Steuerungen.

StepFunStepFun Streaming-Spracherkennungsmodell für chinesische und englische Audiotranskription.

ExaSchnelle LLM-ähnliche Antwort auf eine Frage in natürlicher Sprache, basierend auf frischen Exa-Websuchergebnissen mit Inline-Zitaten und Quelllinks.

ExaWebsuchmaschine zum Finden von Seiten, zum Abrufen ähnlicher Seiten, zum Crawlen und zur gezielten Codesuche im offenen Web nach KI-Agenten.

LinkupIterative KI-Suche, die immer wieder Anfragen anbietet, wenn die ersten Ergebnisse unzureichend sind, und liefert umfassendere Antworten als der Standardmodus.

LinkupKI-gestützte Websuche mit detaillierten Übersichten und Antworten, schneller als Deep Search. Rang #1 im OpenAI SimpleQA-Benchmark.

PerplexityInstitutionelle Forschung, gestützt auf Claude-Opus-4.6-Argumentation, mit maximaler Tiefe, erweitertem Werkzeugzugang und umfangreicher Quellenabdeckung.

PerplexityForschungsmodell für mehrstufige Abfindung, Synthese und Schlussfolgerung, bei dem Quellen über komplexe Themen hinweg autonom gesucht, gelesen und bewertet werden.

MicrosoftTRELLIS.2 Bild-zu-3D-Modell, das ein Referenzbild in ein texturiertes GLB-Asset mit Auflösungs-, Seed-, Mesh-, Textur- und Exportkontrollen verwandelt.

DeemosRodin Gen-2 engine that turns a text prompt or up to five reference images into production 3D assets with PBR materials and quad or raw meshes.

Hitem3DProduction-focused image-to-3D with structure-aware textures, 1536 and 1536 Pro precision tiers, meshes up to two million faces, and five export formats.

Alibaba CloudMehrsprachige Texteinbettung mit wählbaren Ausgabedimensionen (64–2048). Bis zu 8.192 Token pro Eingabe.

Alibaba CloudSpeed-optimised multimodal embedding, same shape as Vision-Plus, 3× cheaper image/video tokens.

Alibaba CloudMultimodale Einbettung erzeugt unabhängige Vektoren für Text-, Bild- und Videoeingänge.

ByteDanceMultimodal embedding that fuses text, images, and video into one 1024 or 2048 dimension vector for cross-modal search and retrieval.

Alibaba CloudSemantischer Dokument-Reranker. Sortiert bis zu 500 Kandidaten pro Abfrage nach Relevanz, unterstützt 100+ Sprachen und akzeptiert eine benutzerdefinierte Sortieranweisung.

GPTZeroDeep-Learning-Detektor, der Textabschnitte markiert, die wahrscheinlich von KI im Vergleich zu Menschen generiert wurden, und Inhalte als vollständig menschlich, KI oder gemischt klassifiziert.

ManusAutonomer KI-Agent, der eine hochrangige Eingabeaufforderung in Unteraufgaben umwandelt, Werkzeuge und APIs aufruft und end-to-end Ergebnisse ohne manuelle Orchestrierung liefert.
Schauen Sie sich unsere Preise an oder kontaktieren Sie uns, wenn Sie Ihr eigenes Modell auf unserem Stack implementieren möchten.