
फ्रेम-सिंक किए गए साउंडट्रैक सीधे वीडियो से उत्पन्न होते हैं, या टेक्स्ट प्रॉम्प्ट से संगीत, प्रति-खंड दिशा और स्टेम पृथक्करण के साथ।
फ्रेम-सिंक किए गए साउंडट्रैक सीधे वीडियो से उत्पन्न होते हैं, या टेक्स्ट प्रॉम्प्ट से संगीत, प्रति-खंड दिशा और स्टेम पृथक्करण के साथ।
sonilo-v1-1/v1/audio/generationssonilo-v1.1sonilo/v1.1sonilo-musicsonilo/sonilo-v1-1EmpirioLabs कैटलॉग से लाइव pay-as-you-go दरें। आप सिर्फ उतना ही भुगतान करते हैं जितना उपयोग करते हैं, कोई मासिक न्यूनतम नहीं।
Sonilo v1.1 POST /v1/audio/generations से चलता है। request तुरंत job_id देती है; job पूरा होने तक GET /v1/jobs/{job_id} को poll करें और परिणाम से आउटपुट URLs पढ़ें। EmpirioLabs डैशबोर्ड से API key प्राप्त करें।
curl https://api.empiriolabs.ai/v1/audio/generations \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "sonilo-v1-1",
"prompt": "Describe what you want Sonilo v1.1 to generate."
}'curl https://api.empiriolabs.ai/v1/jobs/JOB_ID \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY"import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/generations",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={
"model": "sonilo-v1-1",
"prompt": "Describe what you want Sonilo v1.1 to generate.",
},
)
job = response.json()
# Generation runs as an async job. Poll until it completes.
import time
while True:
status = requests.get(
f"https://api.empiriolabs.ai/v1/jobs/{job['job_id']}",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
).json()
if status.get("status") in ("completed", "failed"):
print(status)
break
time.sleep(5)EmpirioLabs पर Sonilo v1.1 API द्वारा समर्थित request पैरामीटर। फ़ील्ड छोड़ने पर डिफ़ॉल्ट मान लागू होते हैं।
| पैरामीटर | प्रकार | डिफॉल्ट | रेंज / मान | विवरण |
|---|---|---|---|---|
| prompt | string | - | - | संगीत के लिए शैली या रचनात्मक दिशा। अकेले पाठ से उत्पन्न करते समय आवश्यक है। वीडियो स्कोर करते समय वैकल्पिक, जहां फुटेज आगे बढ़ता है। |
| mode | enum | auto | auto, text, video | ऑटो एक संलग्न वीडियो स्कोर करता है और कोई वीडियो न होने पर टेक्स्ट से संगीत पर वापस आ जाता है। व्यवहार को पिन करने के लिए टेक्स्ट या वीडियो सेट करें। |
| duration | number | - | 5 से 360 | सेकंड में लंबाई ट्रैक करें। केवल टेक्स्ट मोड। वीडियो मोड में ट्रैक स्रोत वीडियो की लंबाई का अनुसरण करता है। संकेत को निर्णय लेने देने के लिए खाली छोड़ दें। |
| output_format | enum | m4a | m4a, wav, mp3 | वितरित ऑडियो प्रारूप। m4a AAC है, wav 16-बिट PCM है, mp3 320 kbps है। |
| variants_num | number | 1 | 1 से 10 | एक अनुरोध में कितने अलग-अलग संगीत दिशाएँ उत्पन्न करनी हैं। प्रत्येक प्रकार को प्रति सेकंड दर पर अलग-अलग बिल किया जाता है, और 10 सेकंड का न्यूनतम प्रत्येक पर लागू होता है। |
| stems | boolean | false | - | इसके अलावा उत्पन्न ट्रैक ड्रम, बास, वोकल्स और अन्य में विभाजित लौटाएं। कोई शुल्क नहीं जोड़ता है और प्रतीक्षा में कुछ मिनट जोड़ता है। |
| ducking | boolean | false | - | स्रोत वीडियो में भाषण के नीचे डूबा हुआ संगीत के साथ एक टेक भी लौटाएं ताकि संवाद समझदार रहे। कोई शुल्क नहीं जोड़ता है। |
| preserve_speech | boolean | false | - | भाषण को स्रोत वीडियो से रखें और संगीत के साथ अलग-थलग आवाज और एक मिश्रित ट्रैक लौटाएं। |
| prompt_influence | number | 0.5 | 0 से 1 | फुटेज के बजाय संगीत कितनी दृढ़ता से संकेत का पालन करता है। कम वीडियो को लीड करने देता है, उच्च संकेत का अधिक शाब्दिक रूप से अनुसरण करता है। कोई शुल्क नहीं जोड़ता है। |
| segments | string | - | - | समयबद्ध खंड की JSON सरणी दृश्य दिशा के लिए संकेत देती है। प्रत्येक प्रविष्टि सेकंड में प्रारंभ, अंत और संकेत देती है। |
| video_url | string | - | - | स्कोर करने के लिए स्रोत वीडियो, सार्वजनिक रूप से पहुंच योग्य URL के रूप में। 300MB और 6 मिनट तक। playground में वीडियो अपलोड करना आपके लिए यह सेट करता है। |
मोड - संलग्न वीडियो को ऑटो स्कोर करता है, और कोई वीडियो न होने पर टेक्स्ट टू म्यूजिक पर वापस आ जाता है - वीडियो मोड स्रोत फुटेज के कट और पेसिंग का अनुसरण करता है - टेक्स्ट मोड अकेले प्रॉम्प्ट से उत्पन्न होता है नियंत्रण टेक्स्ट मोड में 5 से 360 सेकंड की अवधि, एम4ए, डब्ल्यूएवी या एमपी3 आउटपुट, 1 से 10 वेरिएंट, स्टेम सेपरेशन, डकिंग, स्पीच प्रिजर्वेशन, प्रॉम्प्ट इंफ्लुएंस और जेएसओएन सेगमेंट प्रॉम्प्ट का समर्थन करता है। सीमाएं - 300 एमबी और 6 मिनट तक स्रोत वीडियो - टेक्स्ट मोड में अवधि 5 से 360 सेकंड। वीडियो मोड स्रोत की लंबाई का अनुसरण करता है - डकिंग, भाषण संरक्षण और शीघ्र प्रभाव केवल वीडियो मोड पर लागू होता है बिलिंग - प्रति ट्रैक न्यूनतम 10 सेकंड के साथ, कैटलॉग दर पर प्रति उत्पन्न सेकंड चार्ज किया जाता है। एक 4 सेकंड का ट्रैक 10 सेकंड का बिल देता है। - प्रत्येक संस्करण को अलग से बिल किया जाता है और 10 सेकंड का न्यूनतम प्रत्येक पर लागू होता है। - स्टेम पृथक्करण, डकिंग और शीघ्र प्रभाव कोई शुल्क नहीं जोड़ते हैं। - पीढ़ी से पहले अस्वीकार किए गए अनुरोध को बिल नहीं दिया जाता है।
EmpirioLabs पर Sonilo v1.1 का बिल उपयोग के अनुसार बनता है: संगीत के लिए पाठ $0.0045 प्रति उत्पन्न सेकंड; संगीत के लिए वीडियो $0.018 प्रति उत्पन्न सेकंड। इस पेज की लाइव दर तालिका हमेशा API की वास्तविक बिलिंग से मेल खाती है।
Sonilo v1.1 api.empiriolabs.ai पर POST /v1/audio/generations के ज़रिए मिलता है, मानक Bearer टोकन प्रमाणीकरण के साथ।
हां। EmpirioLabs playground ब्राउज़र में Sonilo v1.1 को उन्हीं पैरामीटरों के साथ चलाता है जो API देता है, ताकि आप कोड लिखने से पहले prompt आज़मा सकें।
EmpirioLabs खाता बनाएं, फिर डैशबोर्ड में API Keys में key जनरेट करें। बिलिंग pay-as-you-go क्रेडिट से होती है, इसलिए आप सिर्फ अपनी requests का भुगतान करते हैं।
हमारे मूल्य निर्धारण की जाँच करें या यदि आप चाहते हैं कि आपका अपना मॉडल हमारे स्टैक पर तैनात किया जाए, तो पहुंचें।