تطلق ByteDance Seed Audio 1.0، حيث تُنتج الحوارات والمؤثرات الصوتية من مطالبة واحدة فقط

وفقاً لشركة Beating، أُطلق نموذج Seed Audio 1.0 التابع لـ ByteDance في 22 يوليو، ما يتيح توليد الحوارات والمؤثرات الصوتية والصوتيات المحيطة باستخدام طلب واحد بدقة توقيت تبلغ 100 مللي ثانية. يدعم النموذج إدخال النص والصوت المرجعي، ويمكنه إنتاج ما يقارب دقيقتين من الصوت لكل توليد مع قدرات ممتدة، كما يحافظ على أصوات الشخصيات بصورة متسقة عبر المخرجات.

تُظهر المخرجات الصوتية قابلية استخدام تتجاوز 90% في معظم السيناريوهات، مع ارتفاع Mean Opinion Score (MOS) إلى أكثر من 4 في أغلب اللغات المدعومة. يدعم Seed Audio 1.0 أكثر من 20 لغة مع نقل أصوات بين اللغات وتخصيص النبرة. أصبح النموذج متاحاً الآن عبر مركز تجربة Volcano Ark مع فتح تكامل واجهة برمجة التطبيقات.

إخلاء المسؤولية: قد تكون المعلومات الواردة في هذه الصفحة مستمدة من مصادر خارجية وهي للمرجعية فقط. لا تمثل هذه المعلومات آراء أو وجهات نظر Gate ولا تشكل أي نصيحة مالية أو استثمارية أو قانونية. ينطوي تداول الأصول الافتراضية على مخاطر عالية. يرجى عدم الاعتماد حصرياً على المعلومات الواردة في هذه الصفحة عند اتخاذ القرارات. لمزيد من التفاصيل، يرجى الرجوع على إخلاء المسؤولية.
تعليق
0/400
لا توجد تعليقات