15 أيه آي
| موقع الويب | |
|---|---|
| تجاري؟ |
لا |
| نوع الموقع | |
| التأسيس | |
| الوضع الحالي |
غير نشط |
| اللغة |
الإنجليزية |
|---|---|
| ترخيص المحتوى | |
| لغة البرمجة | |
| التسجيل |
لا يوجد |
| المالك |
15 |
|---|---|
| المؤسس |
15 |
15 أيه آي (الإنجليزية: 15.ai) كان تطبيق ويب مجانيًا وغير تجاري يستخدم ذكاء اصطناعي لتوليد تصنيع كلامي لأصوات شخصيات خيالية من إعلام. أنشأه باحث في مجال الذكاء الاصطناعي مجهول يُعرف باسم 15، بدأ تطوير هذه التقنية عندما كان فتى غض خلال بحثه الجامعي في معهد ماساتشوستس للتقانة. أتاح التطبيق للمستخدمين جعل شخصيات من لعبة فيديو وبرنامج تلفزيون وفيلم تنطق نصوصًا مخصصة بنبرات عاطفية، أسرع من الزمن الحقيقي.[ا] اشتهرت المنصة بقدرتها على توليد صوت مقنع باستخدام كمية ضئيلة من بيانات التدريب—وقد أشار اسم "15 أيه آي" إلى ادعاء مبتكرها بأن الصوت يمكن نسخه بواسطة 15 ثانية فقط من التسجيل الصوتي، على عكس نماذج التعلم العميق المعاصرة التي كانت تتطلب عادة عشرات الساعات من البيانات الصوتية. وكانت مثالًا مبكرًا لتطبيق ذكاء اصطناعي مولد خلال المراحل الأولية من طفرة الذكاء الاصطناعي.
أُطلق التطبيق في مارس 2020، وذاع صيته على نطاق واسع في أوائل عام 2021 عندما أصبحت مقاطع محتوى تستخدمه ظاهرة فيروسية على منصات التواصل الاجتماعي مثل يوتيوب وإكس. وسرعان ما أصبح شائعًا بين مجتمعات المعجبين على الإنترنت، مثل معجبي ماي ليتل بوني: فرندشيب إز ماجيك وتيم فورتريس 2 وسبونج بوب سكوير بانتس. تميزت الخدمة بدعمها للسياق العاطفي في توليد الكلام باستخدام إيموجيات، والتحكم الدقيق في النطق من خلال نسخ صوتيات، وقدرات متعددة المتحدثين التي سمحت لنموذج واحد بتوليد أصوات شخصيات متنوعة. يُنسب إلى 15 أيه آي أنه أول منصة رئيسية قامت بتعميم تقنيات نسخ الأصوات عبر الذكاء الاصطناعي (تزييف صوتي) ضمن ميم إنترنت وصناعة المحتوى.[1]
ناقش ممثلو تمثيل صوتي ومحترفو الصناعة مزايا 15.ai فيما يخص الإبداع الجماهيري مقابل تأثيره المحتمل على المهنة. ورغم أن العديد من النقاد أشادوا بسهولة الوصول للتطبيق وقدرته على التحكم العاطفي، فقد أشاروا أيضًا إلى وجود قيود تقنية في مجالات مثل خيارات اللحن ودعم اللغات غير الإنجليزية. أثار 15.ai نقاشات حول التبعات الأخلاقية، بما في ذلك مخاوف بشأن بطالة بسبب التقانة للممثلين الصوتيين، والاحتيال الصوتي، والتزييف العميق للمواد الإباحية.
في يناير 2022، أثارت شركة صوت العالم (الإنجليزية: Voiceverse) جدلًا حين اكتُشف أنها استخدمت 15 أيه آي لتوليد مقاطع صوتية دون نسب المصدر، وقامت ببيعها كرموز غير قابلة للاستبدال دون إذن.[2] وصفت جميع وسائل الإعلام هذه الحادثة بأن منصة صوت العالم "سرقت" المقاطع الصوتية من 15.ai.[2] وفي نهاية المطاف، أُزيلت الخدمة من الإنترنت في سبتمبر 2022 بسبب قضايا قانونية تتعلق بالذكاء الاصطناعي. وأعقب إغلاقها ظهور بدائل تجارية مختلفة في السنوات التالية، وقد أقر مؤسسوها بتأثير 15 أيه آي الرائد في مجال التعلم المتعمق.
التاريخ
[عدل | عدل المصدر]الخلفية
[عدل | عدل المصدر]
شهد مجال تصنيع الكلام الاصطناعي تحولًا كبيرًا مع إدخال تقنيات التعلم المتعمق. ففي عام 2016، نشرت شركة ديب مايند الورقة البحثية الرائدة ويف نت: نموذج توليدي للصوت الخام، والتي شكّلت نقطة تحول نحو الاعتماد على الشبكات العصبية الاصطناعية في تصنيع الكلام، حيث عرضت جودة صوت غير مسبوقة باستخدام شبكات عصبية التفافية سببية. في السابق، كان التوليف التجميعي — الذي يعتمد على تجميع مقاطع مسجلة مسبقًا من الكلام البشري— هو الأسلوب السائد، لكنه كان غالبًا ما ينتج أصواتًا آلية وغير طبيعية خاصة عند حدود الجمل.[3]
وبعد عامين، قدمت شركة جوجل أيه آي نظام تاكوترون 2 في 2018، الذي أظهر أن الشبكات العصبية يمكنها إنتاج كلام طبيعي للغاية، لكنه كان يتطلب بيانات تدريبية ضخمة—عادةً عشرات الساعات من التسجيلات الصوتية—لتحقيق جودة مقبولة. وعند تدريبه على مجموعات بيانات أصغر، مثل ساعتين من الكلام، تنخفض جودة المخرجات مع بقاء الكلام قابلًا للفهم، أما مع 24 دقيقة فقط من التدريب، فيفشل تاكوترون 2 في إنتاج كلام مفهوم.[4]
وفي نفس العام، ظهر هاي فاي-ججان، وهو مولد خصومي توليدي يُستخدم كـ "فوكودر" حسن من كفاءة إنتاج الموجات الصوتية وقدم صوتًا عالي الدقة،[5] تلاه غلو-تي تي سي، الذي أدخل نهجًا مولدًا قائمًا على التدفق، مما أتاح توليدًا سريعًا ونقلًا لأسلوب الصوت.[6] كما ساهمت شركات التقنية الصينية مثل بايدو وبايت دانس في دفع المجال قدمًا عبر تطوير أطر توليد صوت نصي خاصة بها، رغم أن تفاصيلها التقنية بقيت سرية إلى حد كبير.[7]
التطوير والإصدار والتشغيل
[عدل | عدل المصدر]كما يُظهر تقدم أبحاثي بطريقة أكثر تفاعلية—فعند استخدامك للنموذج مباشرة، يمكنك اكتشاف أشياء لم أكن أعلم بها بنفسي (مثل جعل الشخصيات تصدر أصوات تنهّد أو أنين بمجرد وضع فواصل بين بعض الأصوات).
كما أنه لا يسمح لي بانتقاء أفضل النتائج فقط لعرضها... التفاعل الحر مع النموذج يتيح للمستخدم الحكم مباشرة على جودة العمل الحالي.تم ابتكار 15 أيه آي في عام 2016 كمشروع بحثي في مجال التعلم المتعمق على يد مطوّر يُعرف باسم "15" (وكان عمره حينها 18 عامًا[9]) خلال سنته الدراسية الأولى في معهد ماساتشوستس للتقنية ضمن برنامج الفرص البحثية للطلاب الجامعيين.[10] استلهم المطوّر الفكرة من ورقة ويف نت (الإنجليزية: WaveNet) التي نشرتها ديب مايند، واستمر في تطوير النموذج خلال دراسته، تزامنًا مع إصدار جوجل أيه آي لنظام تاكوترون 2 في العام التالي. وبحلول عام 2019، كان المطوّر قد أثبت في MIT قدرته على إعادة إنتاج نتائج ويف نت وتاكوترون 2 باستخدام 75% من بيانات التدريب فقط مقارنةً بما كان مطلوبًا سابقًا.[7] يشير اسم "15" إلى ادعاء المنشئ بأن بالإمكان استنساخ الصوت من مجرد 15 ثانية من البيانات.[11]
وكان المطوّر يخطط في الأصل لمتابعة دراسة الدكتوراه استنادًا إلى أبحاثه الجامعية، لكنه قرر العمل في وادي السيليكون بعد أن تم قبول شركته الناشئة في مسرّعة واي كومبناتور في عام 2019. وبعد مغادرته في أوائل 2020، عاد المطوّر إلى أبحاثه في تصنيع الصوت وطبّقها كـتطبيق ويب. ووفقًا لمنشور له على إكس في عام 2024، بدلاً من استخدام مجموعات بيانات تقليدية مثل إل جي سبيتش التي تحتوي على تسجيلات بسيطة ومسطّحة، بحث عن عينات صوتية أكثر تحديًا يمكنها إظهار قدرة النموذج على التعامل مع أنماط الكلام المعقدة والنبرات العاطفية.[tweet 1]
لعب مشروع "حفظ المهرات" (الإنجليزية: Pony Preservation Project) —وهو مبادرة جماهيرية انطلقت من منتدى /mlp/ على فورتشان المتعلق بـماي ليتل بوني—دورًا محوريًا في التنفيذ. فقد قام المشاركون فيه بقص وضبط وضبط الضوضاء ونسخ وتصنيف العواطف لكل جملة في المسلسل يدويًا. وقد وفّر هذا مجموعة بيانات مثالية لتدريب نموذج التعلم العميق الخاص بـ15.ai.[7]

تم إطلاق 15.ai في مارس 2020 بمجموعة محدودة من الشخصيات، بما في ذلك شخصيات من ماي ليتل بوني: فرندشيب إز ماجيك وتيم فورتريس 2.[12] وقد صُمم النظام ليعمل بكفاءة باستخدام كمية محدودة من بيانات التدريب والتحقق والاختبار—بحيث يتطلب فقط دقائق من الصوت النقي لكل شخصية، على عكس أكثر من 40 ساعة التي تحتاجها النماذج التقليدية المعتمدة على التعلم العميق.[13] وللتغلب على قيود البيانات، استخدم المطوّر تقنيات محددة من زيادة البيانات لتحسين التعميم، مثل إدخال تنويعات متعمّدة في التهجئة، وأنماط علامات الترقيم، وتشويهات النطق أثناء التدريب.[13]
عند الإطلاق، تم تقديم 15.ai كخدمة مجانية[14] وغير تجارية[15] لا يتطلب تسجيل المستخدم للتشغيل،[16] ويتطلب فقط من المستخدمين قبول شروط الاستخدام قبل المتابعة.[17] سُمح للمستخدمين بإنشاء أي محتوى باستخدام الأصوات المولدة بشرطين محددين: يجب عليهم نسب الفضل لـ 15.ai من خلال تضمين رابط الموقع الإلكتروني في أي منشورات أو مقاطع فيديو أو مشاريع تستخدم الصوت المولَّد؛[18] وكان يُحظر عليهم خلط مخرجات 15.ai مع مخرجات أخرى من تقنيات تحويل النص إلى كلام في نفس العمل،[19] لتجنب تحريف قدرات التكنولوجيا.[20]
تمت إضافة المزيد من الأصوات إلى الموقع خلال الأشهر التالية.[21] وجاء تقدم تقني كبير في أواخر عام 2020 مع تنفيذ تضمين كلمات متعدد المتحدثين داخل الشبكة العصبية العميقة، مما مكّن من تدريب عدة أصوات في وقت واحد بدلاً من الحاجة إلى نموذج منفصل لكل شخصية.[7] هذا لم يسمح فقط بالتوسع السريع من ثمانية إلى أكثر من خمسين صوت شخصية،[9] بل مكّن النموذج أيضًا من التعرّف على أنماط عاطفية شائعة بين الشخصيات، حتى عندما كانت بعض المشاعر مفقودة من بيانات التدريب لبعض الشخصيات.[22]
وبحلول مايو 2020، كان الموقع قد خدم أكثر من 4.2 مليون ملف صوتي للمستخدمين.[23] وفي أوائل عام 2021، زادت شهرة التطبيق بعد أن انتشرت مقاطع تمثيلية ونكات ومحتوى جماهيري تم إنشاؤه باستخدام 15.ai على إكس، تيك توك، ريديت، تويتش، فيسبوك، ويوتيوب.[24] وفي ذروته، تكبدت المنصة تكاليف تشغيل بلغت US$12٬000[11] شهريًا بسبب البنية التحتية اللازمة من خدمات أمازون ويب لدعم ملايين عمليات إنشاء الصوت يوميًا؛ وعلى الرغم من تلقيها عروضًا من شركات لاندماج واستحواذ 15 أيه آي وتقنيتها الأساسية، إلا أن الموقع بقي مستقلاً وممولًا من أرباح المطور السابقة من شركته الناشئة،[7] والذي كان يبلغ من العمر حينها 23 عامًا.
جدل منصة "عالم الصوت"
[عدل | عدل المصدر]
في 14 يناير 2022، اندلع جدل بعد اكتشاف أن منصة عالم الصوت (الإنجليزية: Voiceverse NFT) قد نسبت الفضل لنفسها في خطوط صوتية مُولدة من 15 أيه آي دون إذن،[2] وقام ببيعها كرموز غير قابلة للاستبدال (رموز غير قابلة للاستبدال).[2] جاء هذا بعد وقت قصير من تصريح مطور 15.ai في ديسمبر 2021 بأنه لا يهتم بدمج الرموز غير القابلة للاستبدال في عمله.[25] وقد أظهرت سجلات السجل أن عالم الصوت قد أنشأ تسجيلات صوتية لشخصيات من ماي ليتل بوني: فرندشيب إز ماجيك باستخدام 15.ai، ورفعوا نغمتها الصوتية لجعلها غير قابلة للتعرف من الأصوات الأصلية لتسويق منصتهم الخاصة[26]—وذلك في انتهاك صريح لشروط خدمة 15.ai التي تحظر الاستخدام التجاري وتتطلب الإسناد المناسب.[27]
في البداية، زعمت "عالم الصوت" أن منصتها ستسمح لمالكي الرموز غير القابلة للاستبدال بالحصول على حقوق تجارية للأصوات المُولدة بالذكاء الاصطناعي لاستخدامها في إنشاء المحتوى، والدردشات داخل الألعاب، والمكالمات المرئية.[28] وعند مواجهتهم بالأدلة على استيلائهم غير المشروع، ادعت عالم الصوت أن أحد أعضاء فريق التسويق هو من استخدم الصوت دون نسبه بشكل صحيح إلى 15.ai،[29] وشرحوا في خادم ديسكورد الخاص بهم أن فريق التسويق كان في عجلة من أمره لإنشاء عرض تقني للشراكة، فقام باستخدام 15.ai دون انتظار جاهزية تقنيتهم الصوتية الخاصة.[30] تم حذف التغريدة المثيرة للجدل بعد ذلك.[31] وردًا على اعتذارهم، غرد حساب 15 قائلاً: "اذهب واغتصب نفسك"[32]، وهي تغريدة أصبحت شائعة جدًا، حيث حصدت مئات الآلاف من الإعجابات وإعادة التغريد على إكس دعمًا للمطور.[7] وعبر 15 لاحقًا عن إحباطه العميق، كاتبًا: "المجال الكامل لتوليف الأصوات يُساء تمثيله الآن من قبل الدجالين الذين يهتمون فقط بالمال."[19]
تروي بيكر منصة إكس @TroyBakerVA أنا أشارك مع @VoiceverseNFT لاستكشاف طرق يمكننا من خلالها سويًا تقديم أدوات جديدة للمبدعين الجدد لصنع أشياء جديدة، والسماح للجميع بفرصة امتلاك والاستثمار في الملكيات الفكرية التي يصنعونها. لدينا جميعًا قصة نرويها. يمكنك أن تكره. أو يمكنك أن تُبدع. فماذا ستختار؟
14 يناير 2022[33]
في أعقاب الجدل المستمر وكشف السرقة الأدبية، واجه الممثل الصوتي تروي بيكر (الذي تعاون مع عالم الصوت) انتقادات لدعمه مشروع رموز غير قابلة للاستبدال[34] ولهجة إعلانه الاستفزازية.[35] وقد وصف بيكر خدمة المنصة بأنها تتيح للأشخاص "إنشاء كتب صوتية مخصصة، أو مقاطع فيديو على يوتيوب، أو محاضرات تعليمية إلكترونية، أو حتى بودكاست باستخدام صوتك المفضل دون متاعب قانونية إضافية"،[17] وهو ما أثار قلق النقاد بشأن احتمالية بطالة بسبب التقانة.[36] لاحقًا، أقر بيكر بأن تغريدته الأصلية التي ختمها بـ"يمكنك أن تكره. أو يمكنك أن تُبدع. فماذا ستختار؟" ربما كانت "استفزازية"،[37] وفي 31 يناير أعلن أنه سينهي شراكته مع "عالم الصوت".[38]
أثار هذا الحدث مخاوف بشأن مشاريع الرموز غير القابلة للاستبدال، إذ لاحظ النقّاد أنها كثيرًا ما تقترن بانتهاكات حقوق الملكية الفكرية وممارسات تجارية مشبوهة.[39] وقد تم توثيق الحادث لاحقًا في «قاعدة بيانات حوادث الذكاء الاصطناعي»، وصُنّف كمثال على "صوت مُركّب بالذكاء الاصطناعي تم بيعه على منصة "عالم الصوت" كرمز غير قابل للاستبدال، وقد أقرّت الشركة بأنه قد تم إنشاؤه باستخدام 15 أيه آي، وهو تطبيق ويب مجاني متخصص في تحويل النص إلى كلام وتوليد الأصوات بالذكاء الاصطناعي، وأُعيد استخدامه دون إسناد مناسب."[40]
كما ظهرت هذه القضية في مشروع الكاتبة وناقدة العملات المشفّرة مولي وايت، والذي وثّق كيف أن إعلان تروي بيكر عن الشراكة بنبرة استفزازية زاد من الانتقادات الموجهة لمبادرة الرموز غير القابلة للاستبدال.[41] وأشارت وايت إلى الطبيعة الغامضة لما تقدّمه "عالم الصوت"، التي وصفت خدمتها بأنها "توفر لك ملكية لصوت فريد في الميتافيرس"،[42] وأوضحت كيف أن انكشاف استخدامهم لأعمال مسروقة من 15.ai قد أضرّ بمصداقية "عالم الصوت" أكثر فأكثر.[41]
من جهتها، صنّفت المنصة التعليمية الروسية سكيلبوكس صوتي وصانع المحتوى على يوتيوب يونغ يي فكرة الرموز الصوتية غير القابلة للاستبدال لتأثيرها المحتمل على صناعة التمثيل الصوتي،[38] وصرّح في فيديو لاحق على قناته في يوتيوب:
"هذه ليست من الأمور التي يمكن أن تقول فيها المنصة ببساطة 'أوه، عذرًا!'. لقد انتحلوا عمل شخصٍ آخر واستخدموه كوسيلة للترويج الكاذب لجودة منتجاتهم، عبر استخدام ذكاء اصطناعي صوتي أعلى جودة لتسويق شركتهم من أجل مصلحتهم الخاصة."[video 1]
وفي دعوى جماعية رُفعت عام 2024 ضد شركة لوفو، زعمت وثائق المحكمة أن مؤسسي لوفو هم أنفسهم من أنشأ عالم الصوت، حيث ادعى المدّعون أن منصة عالم الصوت "ثبت بالفعل أنها سرقت تقنية من [15 أيه آي]".[43]
توقف النشاط
[عدل | عدل المصدر]في سبتمبر 2022، تم إيقاف موقع 15.ai عن العمل[44] بسبب مشكلات قانونية تتعلق بـالذكاء الاصطناعي.[7] وقد ألمح المطوّر إلى إمكانية إصدار نسخة مستقبلية تأخذ في الاعتبار المخاوف المتعلقة بحقوق النشر من البداية، إلا أن الموقع لا يزال غير نشط حتى عام 2025.[7]
الميزات
[عدل | عدل المصدر]كانت المنصة غير تجارية،[15] وتعمل دون الحاجة لتسجيل المستخدمين أو إنشاء حسابات.[16] كان المستخدمون يولدون الكلام عبر إدخال نص واختيار صوت شخصية، مع معلمات اختيارية لمحددات السياق العاطفي والنسخ الصوتي. كل طلب يُنتج ثلاث نسخ صوتية تختلف في النبرة العاطفية، مرتبة حسب درجة مجال الثقة.[45] تضمنت الشخصيات المتاحة عدة شخصيات من تيم فورتريس 2 وماي ليتل بوني: فرندشيب إز ماجيك، بما في ذلك توايلايت سباركل؛ غلادوس، ويتلي، والبرج المدفعي من سلسلة بورتال؛ سبونج بوب سكوير بانتس؛ كيو شوغردست من هوني بوب، رايز كوجيكاوا من بيرسونا 4؛ داريا وجين لين من داريا؛ كارل بروتاناناديليوسكي من فرقة الجوع للمراهقين المائيين؛ ستيفن يونيفرس من ستيفن البطل؛ سانز من أندرتيل؛ مادلين وعدة شخصيات من سيليست؛ الدكتور العاشر من مسلسل دكتور هو؛ ذا ستانلي بيربل؛ وهال 9000 من 2001: ملحمة الفضاء.[46] من بين أكثر من خمسين صوتًا متاحًا، كانت ثلاثون منها لشخصيات من ماي ليتل بوني: فرندشيب إز ماجيك.[21] بعض الشخصيات "الصامتة" مثل تشيل وجوردون فريمان كانت متاحة كنوع من المزاح، حيث تنتج ملفات صوتية صامتة عند إدخال أي نص.[47] شخصيات من أندرتيل وسيليست لم تكن تنطق كلمات، بل تنتج أصوات "بيب" مميزة كما في ألعابها.[48]

كان 15 أيه آي يولّد الصوت بمعدل 44.1 كيلوهرتز استعيان—وهو أعلى من المعيار 16 كيلو هرتز المستخدم في أغلب أنظمة تحويل النص إلى كلام المبنية على التعلم العميق آنذاك. هذه الدقة الأعلى سمحت بإنتاج صورة طيفية صوتية أكثر تفصيلًا وجودة صوتية أعلى، لكنها جعلت العيوب الصوتية الناتجة عن التركيب أكثر وضوحًا. أفاد المستخدمون بأنهم استخدموا أوداسيتي لتقليل العينات لإخفاء العيوب الاصطناعية، مع انخفاض في الجودة بالمقابل.[13] كانت معالجة الكلام تتم أسرع من الوقت الحقيقي باستخدام شبكات عصبونية عميقة مخصصة وخوارزميات تركيب صوتي متخصصة.[50] رغم أن التكنولوجيا قادرة على إنتاج 10 ثوانٍ من الصوت في أقل من 10 ثوانٍ من وقت المعالجة (أي "أسرع من الوقت الحقيقي")، إلا أن تجربة المستخدم الفعلية كانت تتطلب وقت انتظار أطول بسبب معالجة آلاف الطلبات في آنٍ واحد، وقد يصل الانتظار لأكثر من دقيقة أحيانًا.[51]
الخصائص غير الحتمية للنموذج العميق كانت تنتج اختلافات في الإلقاء، مماثلة لتسجيلات متعددة لممثلين صوتيين.[52] قدم 15 أيه آي مفهوم محددات السياق العاطفي، والتي تتيح للمستخدمين تحديد النبرة العاطفية للنص عبر عبارات موجهة.[53][7] هذه الخاصية اعتمدت على ديب موجي، وهي شبكة تحليل عاطفي طُورت في مختبر الوسائط في معهد ماساتشوستس للتكنولوجيا. تم تقديمه عام 2017، ويعالج تضمينات إيموجي من 1.2 مليار تغريدة بين 2013 و2017 لتحليل المحتوى العاطفي.[54] إذا احتوى الإدخال على سياق إضافي (يفصل بواسطة شريط عمودي |)، يُستخدم النص التالي كالسياق العاطفي.[55] على سبيل المثال، إذا كان الإدخال اليوم هو يوم عظيم!|أنا حزين جدًا.، ستنطق الشخصية الجملة "اليوم هو يوم عظيم!" بعاطفة تتوافق مع من يقول "أنا حزين جدًا".[56] بعض الشخصيات، مثل توايلايت سباركل من مهرتي الصغيرة: الصداقة سحر، كانت تتيح أوضاعًا عاطفية مسبقة مثل "سعيدة".[57]

استخدم التطبيق بيانات نطق من واجهة برمجة تطبيقات قواميس أوكسفورد، ويكاموس، وقاموس النطق لجامعة كارنيجي ميلون، والذي يستند إلى أربابيت، وهو نظام نسخ صوتي إنجليزي طُور من قبل داربا في السبعينيات. للكلمات الحديثة أو المصطلحات الشائعة على الإنترنت، استخدم النظام بيانات نطق من مواقع محتوى ينتجه المستخدم مثل ريديت، قاموس إيربن، فورتشان، وجوجل.[18] دعم النظام إدخال رموز أربابيت مباشرة، مما سمح للمستخدمين بتصحيح النطق أو تحديد النطق المرغوب للكلمات متجانسة الكتابة مختلفة النطق. يمكن تفعيل رموز أربابيت عبر وضعها بين أقواس معقوفة، مثل {AA1 R P AH0 B EH2 T} لتحديد نطق كلمة "ARPABET (/ˈɑːrpəˌbɛt/ AR-pə-beht).[22] عرضت الواجهة الكلمات المحللة بألوان مختلفة: أخضر للكلمات الموجودة في قاعدة البيانات، أزرق للرموز المدخلة يدويًا، وأحمر للكلمات التي تم توقع نطقها خوارزميًا.[18]
في الإصدارات الأحدث، قدم 15 أيه آي دعمًا متعدد المتحدثين. بدلًا من تدريب نماذج منفصلة لكل صوت، استخدم نموذجًا موحدًا يتعلم عدة أصوات في آنٍ واحد باستخدام تضمين الكلمات لمتحدثين—وهي تمثيلات عددية تمثل الخصائص الصوتية الفريدة لكل شخصية.[7] جنبًا إلى جنب مع السياق العاطفي المقدم من ديب موجي، سمح هذا التصميم للنموذج بتعلم أنماط مشتركة بين تعبيرات الشخصيات المختلفة، حتى إن لم تتوفر أمثلة تدريبية لبعض الحالات العاطفية لكل شخصية.[22]
حدّت المنصة النص المدخل إلى 200 حرف في كل مرة، لكن يمكن للمستخدمين إنشاء عدة مقاطع لإنشاء خطب أطول.[58] تضمنت الواجهة رسومًا ومقاييس تقنية لتأكيد الجانب البحثي للموقع.[9] اسم خوارزمية 15.ai الأساسية كان ديب ثروت.[59] وبدءًا من النسخة v23 من 15.ai، عرضت الواجهة معلومات تحليل شاملة عن النموذج، بما في ذلك نتائج تحليل الكلمات والعواطف. وتم تبسيط نظام النموذج التدفقي وشبكة خصومية توليدية الهجين للمرمز الصوتي وخفض الضجيج بإزالة مدخلات المعلمات اليدوية.[9]
الاستقبال
[عدل | عدل المصدر]الاستقبال النقدي
[عدل | عدل المصدر]وصف النقاد منصة 15 أيه آي بأنها سهلة الاستخدام وقادرة عمومًا على تقليد أصوات الشخصيات بشكل مقنع، مع نتائج متفاوتة أحيانًا. كتبت ناتالي كلايتون من مجلة بي سي غيمر أن صوت سبونج بوب سكوير بانتس تم تقليده بشكل جيد، لكنها أشارت إلى تحديات في محاكاة ذا ستانلي بيربل من لعبة ذا ستانلي بيربل، قائلة: "الخوارزمية ببساطة لا تستطيع التقاط نبرة السخرية الغريبة لراوي ذا ستانلي بيربل". وبالمثل، أشار موقع الألعاب الروسي "رامباجا" إلى أن صوت غلادوس كان مذهلًا لأن "صوتها صُمم في الأصل لمحاكاة الكلام البشري باستخدام الذكاء الاصطناعي"، بينما كان صوت الراوي من مثل ستانلي أقل إقناعًا بسبب نقص بيانات التدريب.[60]
ذكر زاك زويزن من موقع كوتاكو أن "[صديقته] اعتقدت أنه مقطع صوتي جديد مسجل من مؤدية صوت غلادوس". وعلّق كالفن روغونا من موقع الأخبار غاميزو أن بساطة الأداة ساهمت بشكل كبير في انتشارها، إذ مكنت أي شخص على الإنترنت من إنشاء مقاطع صوتية وحفظها بسهولة. كما أبرزت صحيفة يونايتد ديلي نيوز التايوانية قدرة 15.ai على إعادة إنشاء الصوت الميكانيكي لغلادوس، إلى جانب مجموعة متنوعة من خيارات أصوات الشخصيات.[61]
وأفاد موقع ياهو! نيوز تايوان أن "غلادوس في لعبة بورتال يمكنها نطق الجمل بدقة شبه تامة"، لكنه أشار أيضًا إلى أن "هناك الكثير من العيوب، مثل حد الكلمات والتحكم في النبرة، والتي لا تزال تبدو غريبة في بعض العبارات."[62]
وصف كريس بوتون من نشرة بيتسايد الإخبارية الخاصة بالذكاء الاصطناعي قدرة الأداة على تقليد الصوت بـ 15 ثانية فقط من البيانات بأنها "مخيفة"، لكنه أبدى إعجابه بالتقنية وراءها. أما روبن لامورليت من المجلة الفرنسية كلوبيك، فقد وصف التكنولوجيا بأنها "مسلية بشكل شيطاني"، ولاحظ كيف امتلأت منصات تويتر ويوتيوب بمحتوى إبداعي من المستخدمين الذين جربوا الأداة.[63]
ظهرت قدرات المنصة على توليد الأصوات بشكل منتظم على موقع إكوستريا دايلي، وهو موقع معجبين مخصص لبرنامج ماي ليتل بوني: فرندشيب إز ماجيك وأجياله الأخرى، حيث نُشرت تحديثات موثقة، وأعمال معجبين، وإضافات لأصوات شخصيات جديدة. وفي منشور يعرّف بإضافات شخصيات جديدة في 15.ai، كتب مؤسس إكويستريا ديلي شون سكوتيلارو —المعروف أيضًا باسم "سيثيستو" على الإنترنت— أن "بعض الأصوات ليست رائعة بسبب قلة العينات المتوفرة، لكن العديد منها ما يزال مثيرًا للإعجاب." كما وثّق موقع المعجبين الصيني إكويسترا سي إن تطور 15 أيه آي، مسلطًا الضوء على تحديثاته المختلفة، رغم انتقاده لبعض الأخطاء البرمجية وأوقات الانتظار الطويلة في قائمة الانتظار.[64]
كما وجد العديد من النقاد الآخرين أن حد الكلمات، وخيارات النبرة، والطبيعة الحصرية للغة الإنجليزية في التطبيق أمور غير مرضية تمامًا. رأى بيتر بالترج من موقع أخبار أبطال الأنمي الخارقين المهتم بأخبار الأنمي والأبطال الخارقين أن "توليف الصوت تطور إلى حد يصعب فيه تمييز بعض المحاولات المكلفة عن الكلام البشري الحقيقي"، لكنه أضاف أن "في بعض النواحي، لا تزال أصوات مايكروسوفت المحوسبة أكثر تقدمًا من ذلك. كان بالإمكان التأثير على نبرة الأصوات باستخدام رموز خاصة، وكذلك تغيير طبقته الصوتية بحرية. أما مع 15 أيه آي، فأنت تحت رحمة النبرات العشوائية التي تحصل عليها."
وعلى النقيض، أشادت لورين مورتون من موقع حجر، ورقة، بندقية بعمق التحكم في النطق — "إذا كنت مستعدًا للغوص في التفاصيل الدقيقة." وبالمثل، كتب يوجينيو موتو من موقع الأخبار الإسباني Qore.com أن "المستخدمين الأكثر خبرة يمكنهم تغيير معايير مثل التأكيد أو النبرة."[65]
سلط تاكايوكي فوروشيما من موقع دين فامي نيكو قيمر الياباني الضوء على "النطق السلس"، ولاحظ يوكي كوروساوا من موقع أوتوماتون "غنى التعبير العاطفي" كميزة بارزة؛ ولفت كلا المؤلفين اليابانيين الانتباه إلى غياب دعم اللغة اليابانية.[66]
- كوروساوا 2021: "もうひとつ15.aiの大きな特徴として挙げられるのが、豊かな感情表現だ" (الترجمة: "ميزة أخرى كبيرة في 15 أيه آي هي التعبير العاطفي الغني.")
- كوروساوا 2021: "英語版ボイスのみなので注意" (الترجمة: "يرجى ملاحظة أن هذه نسخة بصوت إنجليزي فقط.")
أشار رينان دو برادو من موقع أخبار الألعاب البرازيلي أركادي وخوسيه فيلالوبوس من موقع الألعاب الإسباني لاب سي فور إلى أنه رغم قدرة المستخدمين على خلق نتائج مضحكة بالبرتغالية والإسبانية على التوالي، فإن الأداء الأفضل كان في اللغة الإنجليزية.[67]
وصف موقع أخبار الألعاب الصيني قيمر سكاي التطبيق بأنه "مثير للاهتمام"، لكنه انتقد حد الكلمات للنص ونقص التنغيم.[68]
كتب فرانك بارك من موقع ألعاب الفيديو الكوري الجنوبي زونتاتا أن "الشيء المدهش في 15.ai هو أنه بالنسبة لبعض الشخصيات، هناك حوالي 30 ثانية فقط من البيانات، لكنها تحقق دقة نطق تقارب 100%".[69]
علّق أستاذ تعلم الآلة يونغكيانغ لي في مدونته أن التطبيق ما زال مجانيًا رغم وجود 5,000 مستخدم يولدون أصواتًا في وقت واحد عند كتابة التدوينة.[70]
ذكر ماركو كوكميلو من موقع الألعاب والثقافة الشعبية الجنوب أفريقي غليتشيد أنه بالرغم من حد الـ 200 حرف، فإن النتائج "أدهشته" عند اختباره مع صوت غلادوس.[71] وكتب ألفارو إيبانيز من منشور التكنولوجيا الإسباني ميكروسيرفوس أنه وجد إيقاع الأصوات المولدة من الذكاء الاصطناعي مثيرًا للاهتمام، مشيرًا إلى أن النظام يبدو أنه يكيّف أدائه بناءً على المعنى المقصود من المحتوى.[72]
قدمت المنشورات التقنية ووسائل الإعلام المتخصصة في الذكاء الاصطناعي تحليلات أعمق لقدرات 15.ai وقيودها مقارنة بتقنيات تحويل النص إلى كلام الأخرى في ذلك الوقت.[73] أشار ريونالدي تشاندراسيتا من نشرة الذكاء الاصطناعي نحو علم البيانات إلى أن نماذج الصوت المدربة على مجموعات بيانات أكبر تنتج نواتج أكثر إقناعًا مع صياغة أفضل وتوقفات طبيعية، لا سيما للنصوص الطويلة.[53] وأبرز باي فنغ من وسائل الإعلام التقنية الصينية شين زي يوان على منصة كيو كيو الإنجاز التقني لجودة ناتج 15.ai العالية (بمعدل استعيان 44.1 كيلو هرتز) رغم استخدام بيانات تدريب محدودة، ملاحظًا أن هذه جودة أعلى بكثير من تطبيقات تحويل النص إلى كلام بالتعلم العميق التقليدية التي تستخدم معدل استعيان 16 كيلو هرتز. كما أشار الموقع إلى أن بعض أخطاء النطق حدثت بسبب قلة بيانات التدريب، وهو أمر مفهوم بالنظر إلى أن النماذج التقليدية كانت تتطلب عادةً 40 ساعة تدريب أو أكثر.
- فينغ 2020: "ملفات الصوت التي يولدها هذا الأداة لها معدل أخذ عينات 44100 هرتز، بينما تستخدم معظم تطبيقات تحويل النص إلى كلام المعتمدة على التعلم العميق معدل أخذ عينات 16000 هرتز. لذلك، فإن الصوت الناتج سيكون له طيف صوتي أكثر تفصيلاً (صوت بجودة أعلى)، ولكن العيوب ستكون أكثر وضوحًا."
- فينغ 2020: "بالطبع، النموذج المدرب على مجموعة بيانات صغيرة كهذه يحتوي على عيوب، وقد تُلفظ بعض الكلمات بشكل غير دقيق. في الواقع، هذا مفهوم بسهولة، حتى الإنسان قد لا يستطيع لفظ الكلمات الجديدة بدقة عند مواجهتها. عادة ما تتطلب النماذج التقليدية العميقة أكثر من 40 ساعة من البيانات، لذا فإن معدل الخطأ يكون أقل."
- بالمثل، لاحظ بارث ماهيندرا من نشرة الذكاء الاصطناعي أيه آي ديلي أنه بينما "يقوم النظام بعمل جيد في تقليد معظم الكلمات الأساسية بدقة"، فإنه يواجه صعوبة مع المصطلحات الأكثر تعقيدًا، مشيرًا إلى أن الشخصيات "تخرب تمامًا نطق بعض الكلمات".
- وصف جي يونيو من موقع أخبار التقنية الصيني نت إيز التكنولوجيا وراء 15 أيه آي بأنها "فعالة بشكل ملحوظ"، حيث تتطلب بيانات قليلة فقط لاستنساخ العديد من الأصوات بدقة مع الحفاظ على الفروق العاطفية والتنغيم الطبيعي. لكنه أشار أيضًا إلى محدوديات، ملاحظًا أن التعبير العاطفي "محايد" نسبيًا وأن "المشاعر القصوى" لا يمكن تركيبها بشكل صحيح، مما يجعلها أقل ملاءمة للتطبيقات غير مناسب للعمل.
- كما ذكر جي أن العديد من فيديوهات تزييف عميق تتطلب من المنشئين استخراج وتحرير ساعات من المحتوى الأصلي لنتائج قصيرة جدًا، بينما يمكن لـ 15.ai تحقيق تأثيرات مماثلة أو أفضل مع بضع عشرات من دقائق بيانات التدريب لكل شخصية، رغم أن مشاكل أداء الخادم غالبًا ما تعني أن التركيب قد يستغرق أكثر من دقيقة.
ردود فعل الممثلين الصوتيين للشخصيات
[عدل | عدل المصدر]
شارك بعض الممثلين الصوتيين الذين ظهرت شخصياتهم على 15.ai آرائهم علنًا حول المنصة. في مقابلة عام 2021 على بودكاست تمثيل الصوت في ألعاب الفيديو The VŌC، شرح جون باتريك لووري —مؤدي صوت القناص في تيم فورتريس 2— أنه اكتشف 15 أيه آي عندما عرضت عليه متدربة مسرحية قصيرة أنشأتها باستخدام أصوات مولدة بالذكاء الاصطناعي للقناص والعميل المتخفي من اللعبة. علق لووري قائلاً:
"لا تزال التكنولوجيا بحاجة لوقت طويل قبل أن تصدق حقًا أن هذه مجرد أصوات بشرية، لكنني كنت مندهشًا من مدى ما يمكن لـ 15.ai فعله. بالتأكيد لا تحصل على الأداء الذي تحصل عليه من شخص فعلي قام بتحليل المشهد، [...] لكن أعتقد أنه كمصدر للمعجبين —لمن يريدون تجميع المود وأشياء من هذا القبيل— قد يكون من الممتع للمعجبين استخدام أصوات شخصيات يحبونها."
وأشار إلى تشبيه بالموسيقى قائلاً:
"إذا أردت صوت الجوقة، وأردت صوت الأوركسترا، وكان لديك المال، ستوظف جوقة وأوركسترا. وإذا لم يكن لديك المال، لديك شيء يبدو جيدًا إلى حد ما؛ لكنه ليس مثل الجوقة والأوركسترا."
في بث مباشر عام 2021 على قناته في تويتش، استمع نيت—الممثل الصوتي لشخصية تيم فورتريس 2 من اللعبة—إلى إعادة إنشاء صوت شخصيته بواسطة الذكاء الاصطناعي. وصف الانطباع بأنه "مثير للاهتمام" ولاحظ "هناك بعض الأشياء في الصوت".
مخاوف أخلاقية
[عدل | عدل المصدر]أبدى بعض الممثلين الصوتيين ردود فعل متباينة تجاه قدرات 15.ai. بينما أقر بعض محترفي الصناعة بالابتكار التقني، أبدى آخرون مخاوف بشأن تداعيات التكنولوجيا على مهنتهم.[74] عندما أعلن الممثل الصوتي تروي بيكر عن شراكته مع منصة صوت العالم، التي استغلت تقنية 15 أيه آي بدون إذن، أثار ذلك جدلاً واسعًا في صناعة التمثيل الصوتي.[75] أبدى النقاد مخاوف من احتمال حدوث بطالة بسبب التقانة للممثلين الصوتيين،[76] خطر انتحال الصوت، واحتمالية التزييف العميق في المواد الإباحية.[52] لاحظت روبي إينس من كوتاكو أن "هذا الأمر قد يؤدي إلى فقدان الممثلين لوظائفهم إذ يمكن ببساطة استخدام صوتهم الاصطناعي بدلاً من العمل معهم ودفع أجرهم."[17] في تغطيتها لجدل صوت العالم، أثارت إيدي وي كي من نقطة تفتيش الألعاب القلق من أن "مثل هذه التكنولوجيا قد تدفع الممثلين الصوتيين لفقدان عملهم إذا أصبح استخدام أصوات الذكاء الاصطناعي أسهل وأرخص من العمل المباشر مع الممثل." بينما قيدت 15 أيه آي نطاقها على الشخصيات الخيالية ولم تعيد إنتاج أصوات أشخاص حقيقيين أو مشاهير،[18] أشار عالم الحاسوب أندرو نج إلى أن تقنية مماثلة يمكن استخدامها لذلك، بما في ذلك لأغراض ضارة. في تقييمه لعام 2020 لـ 15 أيه آي، كتب:
"استنساخ الصوت قد يكون منتجًا للغاية. في السينما الأمريكية، قد يغير استخدام الممثلين الافتراضيين. في الرسوم المتحركة والكتب الصوتية، قد يمكن الممثلين الصوتيين من المشاركة في المزيد من الإنتاجات. في التعليم عبر الإنترنت، قد ينتبه الأطفال أكثر للدروس المقدمة بأصوات شخصيات مفضلة. وكم من منتجي فيديوهات اليوتيوب يحبون أن يروي مورغان فريمان الاصطناعي نصوصهم؟"
وعند مناقشة المخاطر المحتملة، أضاف:
"...لكن تركيب صوت ممثل بشري بدون موافقته يُعتبر غير أخلاقي وربما غير قانوني. وهذه التكنولوجيا ستكون جاذبة جدًا لمن يصنعون التزييف العميق، الذين قد يجمعون تسجيلات من الشبكات الاجتماعية لانتحال هوية أشخاص خاصين."
الإرث
[عدل | عدل المصدر]كانت 15 أيه آي من الرواد الأوائل في مجال التزييف الصوتي العميق، مما أدى إلى ظهور ميمات تعتمد على تركيب الكلام بالذكاء الاصطناعي خلال المراحل الأولى من طفرة الذكاء الاصطناعي في عام 2020. تُنسب إلى 15 أيه آي كونها أول منصة شعبية تعمّم استنساخ الصوت بالذكاء الاصطناعي في ميم الإنترنت وإنشاء المحتوى، خاصةً من خلال قدرتها على توليد أصوات شخصيات مقنعة في الوقت الحقيقي دون الحاجة إلى خبرة تقنية واسعة. كان تأثير المنصة ملحوظًا بشكل خاص في مجتمعات المعجبين، بما في ذلك مجتمعات ماي ليتل بوني: فرندشيب إز ماجيك، وبورتال، وتيم فورتريس 2، وسبونج بوب سكوير بانتس، حيث مكنت من إنشاء محتوى فيروسي حقق ملايين المشاهدات عبر منصات التواصل الاجتماعي مثل إكس ويوتيوب. كما استخدم منشئو محتوى Team Fortress 2 المنصة لإنتاج ميمات قصيرة ورسوم متحركة سردية معقدة باستخدام صانع الأفلام المصدر. شملت إبداعات المعجبين مشاهد تمثيلية ورسوم متحركة جديدة مثل فيديو فريق القلعة 2 الشهير اعتراف الجاسوس، ومحتوى مشترك مثل عرض ليانا روبرت، كاتبة غيم إنفورمر، الذي دمج حوارات من بورتال وماي إفكت في تغطيتها للمنصة، وإعادة إنشاء فيديوهات فيروساتية مثل محاكاة متجر سيارات سيارات بيج بيل هيلز، وتكييفات أدب المعجبين باستخدام أصوات شخصيات مولدة بالذكاء الاصطناعي مثل الحلقة المعجبين المؤلفة الإعفاءات الضريبية بطول 17 دقيقة من الصداقة سحر، وفيديوهات موسيقية وتركيبات موسيقية جديدة مثل ريمكس فريق القلعة 2 بعنوان بوتيس هاردباس، ومحتوى حيث تتلو الشخصيات نهمة. نالت بعض إبداعات المعجبين اهتمامًا واسعًا مثل تعديل فيروسي استبدل ظهور دونالد ترامب في وحيد في المنزل 2: ضائع في نيويورك بصوت مولد بالذكاء الاصطناعي لشخصية من تيم فورتريس 2، وظهر ذلك في تقرير على قناة سي إن إن النهارية في يناير 2021. كما دمج بعض المستخدمين تركيب صوت 15.ai مع برنامج الأوامر الصوتية فويس أتاك (الإنجليزية: VoiceAttack) لإنشاء مساعدين شخصيين.
لوحظ تأثيرها في السنوات التي تلت توقفها، مع ظهور عدة بدائل تجارية لسد الفراغ، مثل إلفن لابس التي تستخدم "11 أيه آي" كاسم قانوني لنطاقها الإلكتروني، وسبيتشيفاي. وأقرت شركات الذكاء الاصطناعي الصوتي المعاصر بدور 15.ai الرائد، حيث وصفت شركة بلاي إتش تي الناشئة والممولة من واي كومبناتور إطلاق 15 أيه آي بأنه "اختراق في مجال تحويل النص إلى كلام وتركيب الصوت". وأشاد كليف ويتنزمان، مؤسس ومدير عام سبيتشيفاي، بـ 15 أيه آي لجعل استنساخ الصوت بالذكاء الاصطناعي شائعًا في إنشاء المحتوى من خلال كونها الأولى التي تضم شخصيات معروفة من مجتمعات المعجبين. وكتب ماتي ستانيسزفسكي، المؤسس المشارك والمدير التنفيذي لإلفن لابس، أن 15.ai كانت محورية في مجال تعلم متعمق.
في مؤتمرات بروني، نوقشت 15 أيه آي في العروض التقديمية حول تقاطع ماي ليتل بوني: فرندشيب إز ماجيك والذكاء الاصطناعي.
قبل إغلاقها، أسست 15 أيه آي عدة سوابق تقنية أثرت على التطورات اللاحقة في تركيب الصوت بالذكاء الاصطناعي. أظهرت دمجها للإيموجي لتحليل العواطف جدوى إدخال التوليد الكلامي الواعي بالعواطف، بينما وضع دعمها لنظام أربابيت للنسخ الصوتي معيارًا للتحكم الدقيق بالنطق في أدوات تركيب الصوت الموجهة للجمهور. وكان نموذج المتحدثين المتعدد الموحد في المنصة، الذي أتاح التدريب المتزامن لأصوات شخصيات متنوعة، مؤثرًا بشكل خاص. هذا النهج سمح للنظام بالتعرف على أنماط العواطف عبر أصوات مختلفة حتى عندما تكون بعض العواطف غائبة في مجموعات تدريب شخصية معينة؛ فمثلًا إذا كانت شخصية ما تحتوي على أمثلة للحديث الفرح ولكن لا توجد أمثلة للغضب، وشخصية أخرى بها أمثلة للغضب ولكن لا توجد أمثلة للفرح، يمكن للنظام تعلم توليد كلتا العاطفتين لكلا الشخصيتين من خلال فهم الأنماط المشتركة لتأثير العواطف على الكلام.
كما قدمت 15.ai مساهمة رئيسية في تقليل متطلبات بيانات التدريب لتركيب الصوت. الأنظمة السابقة مثل تاكوترون من جوجل أيه آي وفاست سبيتش من أبحاث مايكروسوفت كانت تحتاج لعشرات الساعات من الصوت لإنتاج نتائج مقبولة، وكانت تفشل في توليد كلام مفهوم بأقل من 24 دقيقة من بيانات التدريب. على النقيض، أثبتت 15.ai قدرتها على توليد الكلام باستخدام بيانات تدريب أقل بكثير، ويشير اسم "15 أيه آي" إلى ادعاء منشئها بأنه يمكن استنساخ صوت باستخدام 15 ثانية فقط من البيانات. أثرت هذه الكفاءة في استخدام البيانات على التطورات اللاحقة في تقنية تركيب الصوت بالذكاء الاصطناعي، حيث أصبح معيار 15 ثانية نقطة مرجعية للأنظمة الصوتية اللاحقة. وقد أكدت شركة أوبن أيه آي في 2024 صحة الادعاء الأصلي بأن 15 ثانية فقط من البيانات تكفي لاستنساخ صوت إنسان.
انظر أيضًا
[عدل | عدل المصدر]الحواشي التوضيحية
[عدل | عدل المصدر]- ↑ المقصود بمصطلح "أسرع من الزمن الحقيقي" في تصنيع الكلام، هو أن النظام يمكنه توليد الصوت بشكل أسرع من مدة الكلام الفعلية—على سبيل المثال، توليد 10 ثوانٍ من الكلام في أقل من 10 ثوانٍ يُعد أسرع من الزمن الحقيقي.
المصادر
[عدل | عدل المصدر]المراجع
[عدل | عدل المصدر]- ↑
- Cocomello 2021: "ولكن في ذلك الوقت، إذا أردت إنشاء حوار خاص بك، كان الأمر يتطلب طبقات من التحسينات الصوتية والتعديلات. لحسن الحظ، تطور العالم، وبفضل تطبيق 15.ai، أصبح بإمكاننا جعل [...] الشخصيات الشهيرة تقول ما نريده"
- MrSun 2021: 大家是否都曾經想像過,假如能讓自己喜歡的遊戲或是動畫角色說出自己想聽的話,不論是名字、惡搞或是經典名言,都是不少人的夢想吧。不過來到 2021 年,現在這種夢想不再是想想而已,因為有一個網站通過 AI 生成的技術,(قالب:Translation هل سبق لك أن تخيلت كيف سيكون الأمر لو أن شخصيات ألعابك أو رسومك المتحركة المفضلة تستطيع قول ما تريد سماعه؟ سواء كانت أسماء أو محاكاة ساخرة أو اقتباسات كلاسيكية، فهذا حلم للكثيرين. لكن مع دخول عام 2021، لم يعد هذا الحلم مجرد خيال، لأن هناك موقعًا يستخدم تقنية الذكاء الاصطناعي لتوليد ذلك.)
- Anirudh VK 2023: "بينما كانت ميمات الصوت المعتمدة على الذكاء الاصطناعي موجودة بشكل ما منذ إطلاق '15.ai' عام 2020، [...]"
- Wright 2023: "كانت أدوات الذكاء الاصطناعي الصوتية المُستخدمة لإنشاء "تزييفات صوتية" موجودة منذ سنوات بأشكال مختلفة، وكان 15.ai مثالًا بارزًا."
- Weitzman 2023: "اكتسب شهرة لأنه كان أول منصة ذكاء اصطناعي صوتية تضم مجموعة من الشخصيات الخيالية من مصادر إعلامية متنوعة"
- Temitope 2024: "خلال هذه الفترة، يُنسب إلى 15.ai الفضل في تعميم تقنية نسخ الأصوات بالذكاء الاصطناعي—والتي غالبًا ما يُشار إليها باسم 'التزييفات الصوتية'—ضمن الميمات والمحتوى الفيروسي والإعلام المُنتَج من قِبل المعجبين."
- Abisola 2025: "يعزو الكثيرون إلى 15.ai كونه أول منصة تحويل نص إلى كلام رئيسية جعلت التزييفات الصوتية تنتشر بشكل فيروسي حقًا."
- 1 2 3 4 [...]
- ↑ Barakat, Turk & Demiroglu 2024.
- ↑ Google 2018
- ↑ Kong, Kim & Bae 2020.
- ↑ Kim et al. 2020.
- 1 2 3 4 5 6 7 8 9 10 Temitope 2024.
- ↑ Hacker News 2022
- 1 2 3 4 Abisola 2025.
- ↑ Chandraseta 2021
- 1 2 Temitope 2024
- ↑ Ng 2020
- 1 2 3 Feng 2020.
- ↑
- Clayton 2021: "ولكن بفضل أداة مجانية عبر الإنترنت تعتمد على التعلم الآلي"
- Oxton 2021: "Благодаря бесплатному онлайн-инструменту, основанному на машинном обучении" ("أداة مجانية عبر الإنترنت تعتمد على التعلم الآلي")
- Paltridge 2021: "إنه 15.ai، موقع مجاني يمكن لأي شخص استخدامه."
- Li 2021: "该网站的访问量为在线任务差不多5000以上,而且目前完全免费" ("عدد زيارات الموقع يزيد عن 5000 في وقت واحد، وهو مجاني تمامًا حاليًا.")
- Lam 2022: "15.ai، تطبيق ويب مجاني متخصص في تحويل النص إلى كلام وتوليد الصوت بالذكاء الاصطناعي"
- Toh 2022: "خدمة تحويل النص إلى كلام المجانية والشهيرة، 15.ai"
- Innes 2022: "15.ai، ذكاء اصطناعي مجاني يمكنه استنساخ الأصوات بدقة"
- 1 2
- Williams 2022: "[...] 15.ai – خدمة تحويل نص إلى كلام غير تجارية."
- Wright 2022: "[...] 15.ai، خدمة تحويل نص إلى كلام غير تجارية."
- Innes 2022: "عند استخدام مشروع 15.ai، يظهر تنبيه ينص على أن المشروع غير مخصص للاستخدام التجاري"
- 1 2
- Villalobos 2021: "كل ما عليك فعله هو الدخول، واختيار GlaDOS من قائمة الشخصيات المتاحة،"
- do Prado 2021: "لاستخدام البرنامج، الأمر بسيط جدًا، ادخله من خلال النقر هنا، ومن شريط الخيارات اختر اللعبة/الرسوم المتحركة/المسلسل الذي تريد الصوت منه، اختر الشخصية واكتب النص." (
)لا يزال النص الموجود في هذه الصفحة في مرحلة الترجمة إلى العربية.
- 1 2 3 Innes 2022.
- 1 2 3 4 Kurosawa 2021.
- 1 2 Beckwith 2022.
- ↑ "حول الموقع". 15.ai (الموقع الرسمي). 2 مارس 2020. مؤرشف من الأصل في 2020-03-03. اطلع عليه بتاريخ 2024-12-23.
- 1 2 Scotellaro 2020b.
- 1 2 3 Kurosawa 2021
- ↑ Mahendra 2020.
- ↑ Feng 2020
- ↑ Lopez 2022
- ↑ Phillips 2022
- ↑ Innes 2022
- ↑ Toh 2022
- ↑ Phillips 2022
- ↑ Коэн 2022: "كما أوضحوا في ديسكورد، كان فريق التسويق في عجلة من أمره لإنشاء عرض توضيحي للشراكة، فلم ينتظر إنشاء صوت مناسب وأخذوه من 15.ai." (قالب:Translation)
- ↑ Piletsky 2022
- ↑ Wright 2022
- ↑ Innes 2022
- ↑ Lopez 2022.
- ↑ White 2022
- ↑ W-K 2022
- ↑ Wright 2022
- 1 2 Parker 2022.
- ↑ Коэн 2022
- ↑ Lam 2022.
- 1 2 White 2022.
- ↑ White 2022
- ↑ Paul Lehrman and Linnea Sage, et al. v. LOVO, Inc., No. 1:24-cv-03770, 38 (S.D.N.Y. 2024) (“Separately, VoiceVerse has already been found to have stolen technology from another company. See Ule Lopez, WCCF Tech, "Voiceverse NFT Service Reportedly Uses Stolen Technology from 15ai," (Jan. 16, 2022), https://wccftech.com/voiceverse-nft-service-usesstolen-technology-from-15ai/.”).
- ↑ Staniszewski 2024
- ↑ Ibáñez 2022
- ↑ Zwiezen 2021
- ↑ Morton 2021
- ↑ Rugona 2021.
- ↑ Ibáñez 2022
- ↑ Feng 2020
- ↑ Chandraseta 2021
- 1 2 Menor 2024.
- 1 2 Chandraseta 2021.
- ↑ Kurosawa 2021
- ↑ Chandraseta 2021: "بإضافة '|' بعد الجملة الأصلية وتوفير جملة إضافية، يمكننا التحكم بالعاطفة التي تُنطق بها الجملة الأصلية. أي أن 'text_1|text_2' ستنتج عبارة صوتية لـ text_1 مع العاطفة الموجودة في text_2."
- ↑ Chandraseta 2021: "لأنه يمكن إجبار النظام على توليد بيانات غير مسبوقة، مثل قول 'اليوم هو يوم عظيم!' بعاطفة حزينة أو غاضبة."
- ↑ Mahendra 2020: "على سبيل المثال، توايلايت سباركل من ماي ليتل بوني تتيح إخراج النص بنمط سعيد."
- ↑ Cocomello 2021
- ↑ Ibáñez 2022.
- ↑ Oxton 2021: "بعض الشخصيات تبدو أفضل من غيرها. أداء غلادوس هو الأفضل، لأن صوتها صُمم أساسًا لمحاكاة الكلام البشري بالذكاء الاصطناعي. للأسف، لا تكفي جميع حوارات الراوي من مثل ستانلي لتعليم الذكاء الاصطناعي تقليد النبرة الغريبة لكيفن برايتنغ."
- ↑ 遊戲 2021: "يوفر موقع 15.ai حاليًا الكثير من مصادر الصوت، [...] بالإضافة إلى لعبة «بورتال»، يدعم الموقع حاليًا أيضًا العديد من أصوات الشخصيات من الألعاب والأفلام والرسوم المتحركة."
- ↑ MrSun 2021: "حتى غلادوس في «بورتال» يمكنها تلاوة أي جملة بدقة. بالطبع أشار الموقع إلى أن هناك عيوبًا كثيرة، مثل حد الكلمات والتحكم في النبرة الذي لا يزال غريبًا قليلاً في بعض العبارات. لكن إن كنت مستعدًا لقضاء الوقت، يمكنك إنشاء محتوى ممتع كما فعل المستخدمون الآخرون."
- ↑ Lamorlette 2021: "يمكنك أن تجد على هذه الشبكات الاجتماعية العديد من الأمثلة لما يمكن تحقيقه من خلال الجمع بين عقل مبدع وتكنولوجيا فعالة ومسلية بشكل شيطاني."
- ↑ www.equestriacn.com 2021.
- ↑ Moto 2021: "في الواقع، يمكن للمستخدمين المتقدمين تغيير بعض المعايير مثل النبرة أو التأكيد."
- ↑ Furushima 2021: "لا يدعم الإدخال الياباني، لكن حتى مع الإدخال باستخدام الحروف اللاتينية (رومجي)، يصدر نطق قريب إلى حد ما. 15.ai هي خدمة تحويل نص إلى كلام، لكن ما يجعلها جديرة بالملاحظة هو نطقها السلس وقدرتها على إعادة إنتاج أصوات الشخصيات في الألعاب."
- ↑
- do Prado 2021: "من الواضح أن البرنامج يعمل باللغة الإنجليزية، لكن يمكنك توليد جمل مربكة ومضحكة جدًا بالبرتغالية، مثل تلك الميمات التي تستخدم أصواتًا بلغات أخرى تتحدث البرتغالية."
- Villalobos 2021: "في هذا الصدد، خلال الساعات الأخيرة أصبح موقع إلكتروني شائعًا يحاكي صوت GLaDOS ليقول كل الكلمات التي تريدها، طالما كانت بالإنجليزية، رغم أنه يمكنك كتابة شيء بالإسبانية وسيحاول نطقه، لكنه لن يفعل ذلك بشكل صحيح."
- ↑
- GamerSky 2021: "على الرغم من أن صوت الذكاء الاصطناعي يفتقر إلى بعض التنغيم، إلا أن التأثير لا يزال مثيرًا للاهتمام." (قالب:Translation "Although the AI's voice lacks some intonation, the effect is still interesting.")
- GamerSky 2021: "حاليًا تقدم 15.ai خيارات شخصيات قليلة نسبيًا، وبسبب حد عدد كلمات النص، فإن الصوت المولد قصير نسبيًا." (قالب:Translation "Currently, 15.ai provides relatively few character options, and due to the word limit of the text, the generated voice is relatively short.")
- ↑ Park 2021: "ما يدهش في 15.ai هو أن البيانات قريبة من 30 ثانية، لكنها تحقق دقة نطق تقارب 100%." (قالب:Translation "[...] what's amazing about 15.ai is that the data is close to 30 seconds long, but it achieves pronunciation accuracy close to 100%.")
- ↑ Li 2021: "عدد الطلبات على الموقع تجاوز 5000 مهمة، وهو لا يزال مجانيًا تمامًا حتى الآن." (قالب:Translation: "The number of requests to the website is more than 5,000 tasks, and it is still currently completely free.")
- ↑ Cocomello 2021.
- ↑ Ibáñez 2022: "وجدت شخصيًا أن التوقفات والإيقاع مثيرتان للاهتمام، ومن الواضح أن النتيجة تُفسر بحسب المحتوى النصي وما يحاول أن ينقله." (قالب:Translation "Personally, I found the pauses and rhythm interesting, and that it is certainly noticeable that depending on the content of the text, the result is 'interpreted' according to what is being trying to convey.")
- ↑ Feng 2020
- ↑ Parker 2022
- ↑ Parker 2022
- ↑ Innes 2022
تغريدات
[عدل | عدل المصدر]- ↑ @fifteenai (7 ديسمبر 2024). "The past and future of 15.ai" (تغريدة). مؤرشف من الأصل في 2024-12-08. اطلع عليه بتاريخ 2024-12-19 – عبر X (formerly Twitter).
مقاطع فيديو
[عدل | عدل المصدر]- ↑ "Troy Baker Faces Mass Backlash For Supporting Shady AI Voice NFTs With Company That Has Stolen Work". يوتيوب. 14 يناير 2022. مؤرشف من الأصل في 2025-06-05. اطلع عليه بتاريخ 2025-03-23.
الاستشهادات
[عدل | عدل المصدر]- Abisola، Shojobi (3 يناير 2025). "The MIT Project That Paved Way For Modern Voice AI". Independent. مؤرشف من الأصل في 2025-02-27. اطلع عليه بتاريخ 2025-02-27.
- Aktaş، Utku (19 يناير 2022). "Troy Baker-backed NFT firm admitted using voice lines from another service without permission". Mobidictum. مؤرشف من الأصل في 2024-06-14. اطلع عليه بتاريخ 2025-03-01.
- Anikó، Angyal (17 يناير 2022). "Voiceverse NFT Uses Stolen Technology!". theGeek. مؤرشف من الأصل في 2023-09-28. اطلع عليه بتاريخ 2025-03-01.
- Barakat، Huda؛ Turk، Oytun؛ Demiroglu، Cenk (2024). "Deep learning-based expressive speech synthesis: a systematic review of approaches, challenges, and resources". EURASIP Journal on Audio, Speech, and Music Processing. ج. 2024 ع. 11. DOI:10.1186/s13636-024-00329-7.
- Baylos, Ramón (17 Jan 2022). "La compañía de NFTs que se alió con el actor de voz de Joel de The Last of Us la ha liado bastante parda" [The NFT company that partnered with the voice actor of Joel from The Last of Us has made quite a mess of things.]. سبورت (صحيفة) (بالإسبانية). Archived from the original on 2025-01-23. Retrieved 2025-03-25.
- Beckwith، Michael (17 يناير 2022). "NFT firm Voiceverse admits it stole work after announcing Troy Baker deal". Metro. مؤرشف من الأصل في 2025-02-27. اطلع عليه بتاريخ 2025-02-28.[هل يوثق بهذا المصدر؟]
- Button، Chris (19 يناير 2021). "Make GLaDOS, SpongeBob and other friends say what you want with this AI text-to-speech tool". Byteside. مؤرشف من الأصل في 2024-06-25. اطلع عليه بتاريخ 2024-12-18.
- Cabibi-Wilkin، Lily (26 يناير 2022). "NFTs Are Bad. So Why Do People Keep Making Them?" (PDF). The Herald. Jonesboro, Arkansas: جامعة أركنساس الحكومية. ص. 2A. مؤرشف (PDF) من الأصل في 2024-07-06. اطلع عليه بتاريخ 2025-03-04.
- Carcasole، David (17 يناير 2022). "Troy Baker's NFT Partner Company Caught Claiming Voice Lines From Another Service As Their Own". PlayStation Universe. مؤرشف من الأصل في 2022-10-06. اطلع عليه بتاريخ 2025-02-28.
- Chandraseta، Rionaldi (21 يناير 2021). "Generate Your Favourite Characters' Voice Lines using Machine Learning". Towards Data Science. مؤرشف من الأصل في 2021-01-21. اطلع عليه بتاريخ 2024-12-18.
- Clayton، Natalie (19 يناير 2021). "Make the cast of TF2 recite old memes with this AI text-to-speech tool". بي سي غيمر. مؤرشف من الأصل في 2021-01-19. اطلع عليه بتاريخ 2024-12-18.
- Cocomello، Marco (20 يناير 2021). "Make Portal's GLaDOS and Other Characters Say Whatever You Want With This New App". GLITCHED. مؤرشف من الأصل في 2025-03-12. اطلع عليه بتاريخ 2025-03-10.
- "CNN Newsroom". سي إن إن. 15 يناير 2021. مؤرشف من الأصل في 2025-01-13.
- do Prado, Renan (19 Jan 2021). "Faça GLaDOS, Bob Esponja e outros personagens falarem textos escritos por você!" [Make GLaDOS, SpongeBob and other characters speak texts written by you!]. Arkade (بالبرتغالية البرازيلية). Archived from the original on 2022-08-19. Retrieved 2024-12-22.
- "Can I publish the content I generate on the platform?". إلفن لابس (Official website). 2024b. مؤرشف من الأصل في 2024-12-23. اطلع عليه بتاريخ 2024-12-23.
- Enriquez، XC (16 يناير 2022). "Voice Actor for Joel Receives Backlash after NFT Tweet". ClutchPoints. مؤرشف من الأصل في 2025-03-23. اطلع عليه بتاريخ 2025-03-23.
- "15.ai已经重新上线,版本更新至v23" [15.ai has been re-launched, version updated to v23]. EquestriaCN (بالصينية). 1 Oct 2021. Archived from the original on 2024-05-19. Retrieved 2024-12-22.
- Feng, Bai (15 Mar 2020). "模型参数过亿跑不动?看MIT小哥,少量数据完成高质量文本转语音!" [Model has over 100 million parameters and won't run? Check out this MIT guy who achieves high-quality text-to-speech with minimal data!]. كيو كيو (بالصينية). XinZhiYuan. Archived from the original on 2025-02-27. Retrieved 2025-02-22.
- "这个网站可用AI生成语音 让ACG角色"说"出你输入的文本" [This Website Can Use AI to Generate Voice, Making ACG Characters "Say" the Text You Input]. GamerSky (بالصينية). 18 Jan 2021. Archived from the original on 2024-12-11. Retrieved 2024-12-18.
- "15.ai – El Deep Fake del Sonido" [15.ai – The Deepfake of Sound]. Gigonway (بالإسبانية). Archived from the original on 2025-06-07. Retrieved 2025-03-23.
- "Audio samples from "Semi-Supervised Training for Improving Data Efficiency in End-to-End Speech Synthesis"". 30 أغسطس 2018. مؤرشف من الأصل في 2020-11-11. اطلع عليه بتاريخ 2022-06-05.
- Groth-Anderson, Magnus (19 Jan 2022). "Troy Baker-støttet NFT-virksomhed indrømmer at have stjålet indhold" [Troy Baker-backed NFT company admits to stealing content]. Gamereactor (بالدنماركية). Archived from the original on 2025-03-01. Retrieved 2025-03-01.
- "15.ai". هاكر نيوز. 12 يونيو 2022. مؤرشف من الأصل في 2023-04-09. اطلع عليه بتاريخ 2024-12-29.
- Innes، Ruby (18 يناير 2022). "Voiceverse Is The Latest NFT Company Caught Using Someone Else's Content". كوتاكو. مؤرشف من الأصل في 2024-07-26. اطلع عليه بتاريخ 2025-02-28.
- Ibáñez, Álvaro (15 Jun 2022). "Un algoritmo que convierte texto a voz «con emoción y sentimiento» e imita a personajes y voces conocidas" [An algorithm that converts text to speech "with emotion and feeling" and imitates familiar characters and voices]. Microsiervos (بالإسبانية). Archived from the original on 2024-12-12. Retrieved 2025-03-23.
- Ji, Yunyo (19 Jan 2021). "这个国外的语音合成网站,可以让玩家操控二次元角色说话" [This foreign speech synthesis website allows players to control the two-dimensional characters to speak]. نت إيز (بالصينية). نت إيز. Archived from the original on 2025-02-27. Retrieved 2025-02-26.
- Kar، Jess (18 يناير 2022). "Troy Baker's Partner Voice NFT Platform Voiceverse Admits to Stealing Audio". NFTGators. مؤرشف من الأصل في 2024-09-15. اطلع عليه بتاريخ 2025-02-28.
- Khavanekar، Aditya (18 يناير 2022). "The NFT company that Troy Baker markets took audio clips from another service". GamingSym.in. مؤرشف من الأصل في 2022-01-19. اطلع عليه بتاريخ 2025-02-28. Alt URL
- Khibchenko, Pavel (15 Feb 2022). "NFT в геймдеве: проблемы регулирования, гнев игроков и поспешные решения разработчиков". Skillbox (بالروسية). Archived from the original on 2023-06-05. Retrieved 2025-02-28.
- Kim، Jaehyeon؛ Kim، Sungwon؛ Kong، Jungil؛ Yoon، Sungroh (2020). "Glow-TTS: A Generative Flow for Text-to-Speech via Monotonic Alignment Search". في Larochelle، Hugo؛ Ranzato، Marc'Aurelio؛ Hadsell، Raia؛ Balcan، Maria-Florina؛ Lin، Hsuan-Tien (المحررون). Advances in Neural Information Processing Systems 33: Annual Conference on Neural Information Processing Systems 2020, NeurIPS 2020, December 6–12, 2020, virtual. arXiv:2005.11129.
- Kong، Jungil؛ Kim، Jaehyeon؛ Bae، Jaekyoung (2020). "HiFi-GAN: Generative Adversarial Networks for Efficient and High Fidelity Speech Synthesis". في Larochelle، Hugo؛ Ranzato، Marc'Aurelio؛ Hadsell، Raia؛ Balcan، Maria-Florina؛ Lin، Hsuan-Tien (المحررون). Advances in Neural Information Processing Systems 33: Annual Conference on Neural Information Processing Systems 2020, NeurIPS 2020, December 6–12, 2020, virtual. arXiv:2010.05646.
- Kuchkanov، Phil (15 يناير 2022). "«NFT-штука Троя Бейкера ворует чужие работы». В сети уничтожают известного актера озвучки" ["Troy Baker's NFT Thing Steals Other People's Work." The Internet Is Destroying a Famous Voice Actor]. GameGuru.ru. مؤرشف من الأصل في 2022-01-15. اطلع عليه بتاريخ 2025-03-23.
- Kurosawa, Yuki (2021). "ゲームキャラ音声読み上げソフト「15.ai」公開中。『Undertale』や『Portal』のキャラに好きなセリフを言ってもらえる" [Game Character Voice Reading Software "15.ai" Now Available. Get Characters from Undertale and Portal to Say Your Desired Lines]. AUTOMATON (باليابانية). Archived from the original on 2021-01-19. Retrieved 2024-12-18.
- Lam، Khoa (14 يناير 2022). "Incident 277: Voices Created Using Publicly Available App Stolen and Resold as NFT without Attribution". AI Incident Database. مؤرشف من الأصل في 2025-01-13. اطلع عليه بتاريخ 2025-02-27.
- Lamorlette, Robin (25 Jan 2021). "Insolite : un site permet de faire dire ce que vous souhaitez à GlaDOS (et à d'autres personnages de jeux vidéo)". Clubic (بالفرنسية). Archived from the original on 2025-01-19. Retrieved 2025-03-23.
- Lawrence، Briana (19 يناير 2022). "Shonen Jump Scare Leads to Company Reassuring Fans That They Aren't Getting Into NFTs". دان إبرامز. مؤرشف من الأصل في 2025-01-13. اطلع عليه بتاريخ 2024-12-23.
- "The disappointment, brother! NFT project supported by Troy Baker used third-party technology". LevelUp.com. LevelUp. 18 يناير 2022. مؤرشف من الأصل في 2022-05-21. اطلع عليه بتاريخ 2025-02-28.
- Li, Yongqiang (2021). "语音开源项目优选:免费配音网站15.ai" [Voice Open Source Project Selection: Free Voice Acting Website 15.ai]. يعرف (بالصينية). Archived from the original on 2024-12-19. Retrieved 2024-12-18.
{{استشهاد بويب}}: صيانة الاستشهاد: علامات ترقيم زائدة (link) - Lopez، Ule (16 يناير 2022). "Voiceverse NFT Service Reportedly Uses Stolen Technology from 15ai [UPDATE]". Wccftech. مؤرشف من الأصل في 2022-01-16. اطلع عليه بتاريخ 2022-06-07.
- Mahendra، Parth (11 مايو 2020). "Spongebob Can Now Narrate Your Writing". AI Daily. مؤرشف من الأصل في 2021-07-01. اطلع عليه بتاريخ 2025-03-04.
- Menor، Deion (7 نوفمبر 2024). "15.ai – Natural and Emotional Text-to-Speech Using Neural Networks". HashDork. مؤرشف من الأصل في 2025-02-23. اطلع عليه بتاريخ 2025-01-03.
- Morton، Lauren (18 يناير 2021). "Put words in game characters' mouths with this fascinating text to speech tool". حجر، ورقة، بندقية. مؤرشف من الأصل في 2021-01-18. اطلع عليه بتاريخ 2024-12-18.
- Moto, Eugenio (20 Jan 2021). "15.ai, el sitio que te permite usar voces de personajes populares para que digan lo que quieras". Qore (بالإسبانية). Archived from the original on 2024-12-28. Retrieved 2024-12-21.
- MrSun (19 Jan 2021). "讓你喜愛的ACG角色說出任何話! AI生成技術幫助你實現夢想" [Let your favorite ACG characters say anything! AI generation technology helps you realize your dreams]. ياهو! نيوز Taiwan (بالصينية). Archived from the original on 2024-12-28. Retrieved 2024-12-22.
- "Troy Bakerin tukema NFT-yhtiö kärähti – Kaupitteli ääninäyttelyä luvatta" [Troy Baker-backed NFT company sued – peddling voice acting without permission]. Muropaketti (بالفنلندية). 17 Jan 2022. Archived from the original on 2022-05-25. Retrieved 2025-03-01.
- Myrén, Jonny (18 Jan 2022). "NFT-företaget som Troy Baker marknadsför tog ljudklipp från annan tjänst" [The NFT company that Troy Baker promotes took audio clips from another service]. FZ (بالسويدية). Archived from the original on 2024-01-01. Retrieved 2025-03-24.
- Ng، Andrew (1 أبريل 2020). "Voice Cloning for the Masses". DeepLearning.AI. مؤرشف من الأصل في 2024-12-28. اطلع عليه بتاريخ 2024-12-22.
- "Navigating the Challenges and Opportunities of Synthetic Voices". أوبن أيه آي. 9 مارس 2024. مؤرشف من الأصل في 2024-11-25. اطلع عليه بتاريخ 2024-12-18.
- Osman، Mohamed (2022). Emo-TTS: Parallel Transformer-based Text-to-Speech Model with Emotional Awareness. معهد مهندسي الكهرباء والإلكترونيات. ص. 169–174. DOI:10.1109/ICCI54321.2022.9756092. ISBN:978-1-6654-9973-6. مؤرشف من الأصل في 2025-05-05. اطلع عليه بتاريخ 2025-04-04.
{{استشهاد بكتاب}}: تجاهل المحلل الوسيط|موقع=(مساعدة) - Oxton (20 Jan 2021). "При помощи AI можно озвучить набранный текст голосами GlaDOS, Мисс Полинг и других персонажей игр" [Using AI, you can voice typed text with the voices of GlaDOS, Miss Pauling and other game characters]. Rampaga (بالروسية). Archived from the original on 2021-02-26. Retrieved 2025-03-22.
- Park, Frank (20 Jan 2021). "게임 캐릭터 음성으로 영어를 읽어주는 소프트 15.ai 공개" [Software 15.ai Released That Reads English in Game Character Voices]. Tistory (بالكورية). Archived from the original on 2024-12-20. Retrieved 2024-12-18.
- Paltridge، Peter (18 يناير 2021). "This Website Will Say Whatever You Type In Spongebob's Voice". Anime Superhero News. مؤرشف من الأصل في 2021-10-17. اطلع عليه بتاريخ 2024-12-22.
- Parker، Jordan (5 فبراير 2022). "Like them or not, NFTs are here to stay". The Journal. Webster University. مؤرشف من الأصل في 2024-11-08. اطلع عليه بتاريخ 2025-03-23.
- Phillips، Tom (17 يناير 2022). "Troy Baker-backed NFT firm admits using voice lines taken from another service without permission". يورو غيمر. مؤرشف من الأصل في 2022-01-17. اطلع عليه بتاريخ 2024-12-31.
- Piletsky، Boris (15 يناير 2022). "Создателей NFT-голосов, которых поддержал Трой Бейкер, уличили в краже голосов в тот же день" [NFT vote creators backed by Troy Baker were caught stealing votes on the same day]. iXBT Games. مؤرشف من الأصل في 2023-09-24. اطلع عليه بتاريخ 2025-03-23.
- "Everything You Need to Know About 15.ai: The AI Voice Generator". Play.ht. 12 سبتمبر 2024. مؤرشف من الأصل في 2024-12-25. اطلع عليه بتاريخ 2024-12-18.
- Ren، Yi؛ Ruan، Yangjun؛ Tan، Xu؛ Qin، Tao؛ Zhao، Sheng؛ Zhao، Zhou؛ Liu، Tie-Yan (2019). "FastSpeech: Fast, Robust and Controllable Text to Speech". في Wallach، Hanna M.؛ Larochelle، Hugo؛ Beygelzimer، Alina؛ d'Alché-Buc، Florence؛ Fox، Emily B.؛ Garnett، Roman (المحررون). Advances in Neural Information Processing Systems 32: Annual Conference on Neural Information Processing Systems 2019, NeurIPS 2019, December 8–14, 2019, Vancouver, BC, Canada. ص. 3165–3174. arXiv:1905.09263.
- "Free 15.ai Character Voice Cloning and Alternatives". Resemble.ai. 17 أكتوبر 2024. مؤرشف من الأصل في 2025-02-08. اطلع عليه بتاريخ 2024-12-31.
- Rugona، Calvin (22 يناير 2021). "Make GLaDos And Other Characters Say What You Want". Gamezo. مؤرشف من الأصل في 2025-03-21. اطلع عليه بتاريخ 2025-03-22.
- Ruppert، Liana (18 يناير 2021). "Make Portal's GLaDOS And Other Beloved Characters Say The Weirdest Things With This App". غيم إنفورمر. مؤرشف من الأصل في 2021-01-18. اطلع عليه بتاريخ 2024-12-18.
- Scotellaro، Shaun (2020b). "15.ai Adds Tons of New Pony Voices". إكوستريا دايلي. مؤرشف من الأصل في 2024-12-26. اطلع عليه بتاريخ 2024-12-21.
- Scotellaro، Shaun (2020c). "Neat "Pony Preservation Project" Using Neural Networks to Create Pony Voices". إكوستريا دايلي. مؤرشف من الأصل في 2021-06-23. اطلع عليه بتاريخ 2024-12-18.
- Scotellaro، Shaun (2020d). "Full Simple Animated Episode - The Tax Breaks (Twilight)". إكوستريا دايلي. مؤرشف من الأصل في 2025-05-10. اطلع عليه بتاريخ 2025-01-01.
- Scotellaro، Shaun (2020e). "More Pony Music! We Shine Brighter Together!". إكوستريا دايلي. مؤرشف من الأصل في 2025-03-31. اطلع عليه بتاريخ 2025-01-01.
- Scotellaro، Shaun (2020f). "New Among Us Animation Goes Viral... With Pony Voices". إكوستريا دايلي. مؤرشف من الأصل في 2025-01-01. اطلع عليه بتاريخ 2025-01-01.
- Skorich، Lina (15 يناير 2022). "Трою Бейкеру пришлось извиняться за решение сотрудничать с NFT-компанией" [Troy Baker forced to apologize for decision to partner with NFT company]. StopGame. مؤرشف من الأصل في 2022-10-02. اطلع عليه بتاريخ 2025-03-23.
- Staniszewski، Mati (2024). "15.AI: Everything You Need to Know & Best Alternatives". إلفن لابس (Official website). مؤرشف من الأصل في 2024-12-25. اطلع عليه بتاريخ 2024-12-18.
- Temitope، Yusuf (10 ديسمبر 2024). "15.ai Creator reveals journey from MIT Project to internet phenomenon". The Guardian. مؤرشف من الأصل في 2024-12-28. اطلع عليه بتاريخ 2024-12-25.
- Toh، Brandon (18 يناير 2022). "Troy Baker's NFT Partner Company Voiceverse Caught Using Voice Lines From Another Service Without Permission". Geek Culture. مؤرشف من الأصل في 2022-11-30. اطلع عليه بتاريخ 2025-02-28.
- 遊戲, 遊戲角落 (20 Jan 2021). "這個AI語音可以模仿《傳送門》GLaDOS講出任何對白!連《Undertale》都可以學" [This AI Voice Can Imitate Portal's GLaDOS Saying Any Dialog! It Can Even Learn Undertale]. United Daily News (بالصينية المبسطة). Archived from the original on 2024-12-19. Retrieved 2024-12-18.
{{استشهاد بويب}}: صيانة الاستشهاد: لغة غير مدعومة (link) - Villalobos, José (18 Jan 2021). "Descubre 15.AI, un sitio web en el que podrás hacer que GlaDOS diga lo que quieras" [Discover 15.AI, a Website Where You Can Make GlaDOS Say What You Want]. LaPS4 (بالإسبانية). Archived from the original on 2021-01-18. Retrieved 2021-01-18.
- Anirudh VK (18 مارس 2023). "Deepfakes Are Elevating Meme Culture, But At What Cost?". Analytics India Magazine. مؤرشف من الأصل في 2024-12-26. اطلع عليه بتاريخ 2024-12-18.
- W-K، Edie (15 يناير 2022). "Troy Baker angers the internet with NFT partnership". Checkpoint Gaming. مؤرشف من الأصل في 2024-12-12. اطلع عليه بتاريخ 2025-02-28.
- Weitzman، Cliff (19 نوفمبر 2023). "15.ai: All about 15.ai and the best alternative". Speechify. مؤرشف من الأصل في 2024-12-25. اطلع عليه بتاريخ 2024-12-31.
- White، Molly (14 يناير 2022). "Voice actor Troy Baker announces his involvement in "voice NFT" project Voiceverse with an antagonistic tweet, shortly before it's revealed that the project stole work". مولي وايت (كاتبة). مؤرشف من الأصل في 2024-07-24. اطلع عليه بتاريخ 2025-02-28.
- Williams، Demi (18 يناير 2022). "Voiceverse NFT admits to taking voice lines from non-commercial service". موسيقى إكسبرس جديدة. مؤرشف من الأصل في 2022-01-18. اطلع عليه بتاريخ 2024-12-18.
- Wright، Steve (17 يناير 2022). "Troy Baker-backed NFT company admits to using content without permission". Stevivor. مؤرشف من الأصل في 2022-01-17. اطلع عليه بتاريخ 2024-12-18.
- Wright، Steven (21 مارس 2023). "Why Biden, Trump, and Obama Arguing Over Video Games Is YouTube's New Obsession". Inverse. مؤرشف من الأصل في 2024-12-20. اطلع عليه بتاريخ 2024-12-18.
- Furushima, Takayuki (18 Jan 2021). "『Portal』のGLaDOSや『UNDERTALE』のサンズがテキストを読み上げてくれる。文章に込められた感情まで再現することを目指すサービス「15.ai」が話題に" [Portal's GLaDOS and UNDERTALE's Sans Will Read Text for You. "15.ai" Service Aims to Reproduce Even the Emotions in Text, Becomes Topic of Discussion]. Den Fami Nico Gamer (باليابانية). Archived from the original on 2021-01-18. Retrieved 2024-12-18.
- Zwiezen، Zack (18 يناير 2021). "Website Lets You Make GLaDOS Say Whatever You Want". كوتاكو. مؤرشف من الأصل في 2021-01-17. اطلع عليه بتاريخ 2024-12-18.
- Коэн (15 Jan 2022). "Создателей голосовых NFT, поддерживаемых Троем Бейкером, обвинили в воровстве голоса". Shazoo (بالروسية). Archived from the original on 2022-01-23. Retrieved 2025-02-28.
