
Frame-synchronisierte Soundtracks, die direkt aus dem Video generiert werden, oder Musik aus einem Textprompt, mit Richtungsrichtung pro Segment und Stammtrennung.
Frame-synchronisierte Soundtracks, die direkt aus dem Video generiert werden, oder Musik aus einem Textprompt, mit Richtungsrichtung pro Segment und Stammtrennung.
sonilo-v1-1/v1/audio/generationssonilo-v1.1sonilo/v1.1sonilo-musicsonilo/sonilo-v1-1Live Pay-as-you-go-Preise aus dem EmpirioLabs-Katalog. Du zahlst nur für das, was du nutzt, ohne monatliches Minimum.
Sonilo v1.1 läuft über POST /v1/audio/generations. Der Request liefert sofort eine job_id; frage GET /v1/jobs/{job_id} ab, bis der Job abgeschlossen ist, und lies die Ausgabe-URLs aus dem Ergebnis. Hol dir einen API-Schlüssel im EmpirioLabs Dashboard.
curl https://api.empiriolabs.ai/v1/audio/generations \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "sonilo-v1-1",
"prompt": "Describe what you want Sonilo v1.1 to generate."
}'curl https://api.empiriolabs.ai/v1/jobs/JOB_ID \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY"import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/generations",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={
"model": "sonilo-v1-1",
"prompt": "Describe what you want Sonilo v1.1 to generate.",
},
)
job = response.json()
# Generation runs as an async job. Poll until it completes.
import time
while True:
status = requests.get(
f"https://api.empiriolabs.ai/v1/jobs/{job['job_id']}",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
).json()
if status.get("status") in ("completed", "failed"):
print(status)
break
time.sleep(5)Request-Parameter, die die Sonilo v1.1 API auf EmpirioLabs unterstützt. Standardwerte gelten, wenn ein Feld weggelassen wird.
| Parameter | Typ | Standard | Bereich / Werte | Beschreibung |
|---|---|---|---|---|
| prompt | string | - | - | Stil oder kreative Richtung für die Musik. Erforderlich beim Erzeugen ausschließlich aus Text. Optional beim Komponieren eines Videos, wohin das Filmmaterial führt. |
| mode | enum | auto | auto, text, video | Automatisch bewertet ein angehängtes Video und greift zurück auf Text zu Musik, wenn kein Video vorhanden ist. Stellen Sie Text oder Video ein, um das Verhalten... |
| duration | number | - | 5 bis 360 | Spurlänge in Sekunden. Nur im Textmodus. Im Videomodus folgt die Spur der Länge des Quellvideos. Lass leer, damit die Eingabeaufforderung entscheiden kann. |
| output_format | enum | m4a | m4a, wav, mp3 | Geliefertes Audioformat. M4A ist AAC, WAV ist 16-Bit-PCM, mp3 320 kbps. |
| variants_num | number | 1 | 1 bis 10 | Wie viele verschiedene musikalische Richtungen in einer Anfrage generiert werden sollen. Jede Variante wird separat mit dem Sekundenpreis berechnet, und für jede... |
| stems | boolean | false | - | Man kann auch den generierten Track in Schlagzeug, Bass, Gesang und anderes zurückgeben. Das kostet keine Kosten und verlängert die Wartezeit um ein paar Minuten. |
| ducking | boolean | false | - | Geben Sie auch eine Aufnahme zurück, bei der die Musik unter der Sprache im Quellvideo eingetaucht ist, damit der Dialog verständlich bleibt. Das kostet nichts. |
| preserve_speech | boolean | false | - | Behalten Sie die Sprache aus dem Quellvideo und geben Sie die isolierte Stimme plus eine gemischte Spur zusammen mit der Musik zurück. |
| prompt_influence | number | 0.5 | 0 bis 1 | Wie stark die Musik dem Prompt folgt und nicht dem Filmmaterial. Niedriger lässt das Video führen, höher folgt dem Prompt wörtlicher. Fügt keine Ladung hinzu. |
| segments | string | - | - | JSON-Array von zeitlich begrenzten Segmentanweisungen für Szene für Szenenrichtung. Jeder Eintrag beginnt, endet und wird innerhalb von Sekunden angezeigt. |
| video_url | string | - | - | Quellen Sie das Video als öffentlich erreichbare URL. Bis zu 300 MB und 6 Minuten. Das Hochladen eines Videos im playground stellt das für Sie ein. |
Modi – bewertet das angehängte Video automatisch und greift zurück auf Text zu Musik, wenn kein Video vorhanden ist – Videomodus folgt den Schnitten und dem Tempo des Quellmaterials – Textmodus generiert ausschließlich aus einem Prompt Steuerung Unterstützt Prompt, Modus, Quellvideo, 5 bis 360 Sekunden Dauer im Textmodus, m4a, WAV- oder MP3-Ausgabe, 1 bis 10 Varianten, Stem-Trennung, Ducking, Spracherhaltung, Prompt-Einfluss und JSON-Segment-Prompts. Limits – Quellvideo bis zu 300 MB und 6 Minuten – Dauer 5 bis 360 Sekunden im Textmodus. Videomodus folgt der Quelllänge – Entdeckung, Spracherhaltung und Prompt-Einfluss gelten nur für den Videomodus Billing – Berechnet pro erzeugter Sekunde nach Katalograte, mit einem Minimum von 10 Sekunden pro Track. Ein 4-Sekunden-Track berechnet 10 Sekunden. - Jede Variante wird separat abgerechnet und für jede gilt das Minimum von 10 Sekunden. - Stem-Separation, Ducking und prompt Influence verursachen keine Gebühren. - Eine vor der Generierung abgelehnte Anfrage wird nicht berechnet.
Auf EmpirioLabs wird Sonilo v1.1 nach Verbrauch abgerechnet: Text zur Musik $0.0045 pro erzeugter Sekunde; Video zur Musik $0.018 pro erzeugter Sekunde. Die Live-Preistabelle auf dieser Seite entspricht immer dem, was die API berechnet.
Sonilo v1.1 wird über POST /v1/audio/generations auf api.empiriolabs.ai mit normaler Bearer-Token-Authentifizierung bereitgestellt.
Ja. Der EmpirioLabs Playground führt Sonilo v1.1 im Browser mit denselben Parametern aus, die die API bietet. So kannst du Prompts testen, bevor du Code schreibst.
Erstelle ein EmpirioLabs-Konto und generiere dann einen Schlüssel unter API Keys im Dashboard. Die Abrechnung erfolgt über Pay-as-you-go-Guthaben, du zahlst also nur für deine Requests.
Schauen Sie sich unsere Preise an oder kontaktieren Sie uns, wenn Sie Ihr eigenes Modell auf unserem Stack implementieren möchten.