انتقل إلى المحتوى

15 أيه آي

من ويكيبيديا، الموسوعة الحرة
15 أيه آي
معلومات عامة
موقع الويب
تجاري؟
لا
نوع الموقع
التأسيس
مارس 2020 عدل القيمة على Wikidata
الوضع الحالي
غير نشط
الجوانب التقنية
اللغة
الإنجليزية
ترخيص المحتوى
لغة البرمجة
التسجيل
لا يوجد
أهم الشخصيات
المالك
15
المؤسس
15

15 أيه آي (الإنجليزية: 15.ai) كان تطبيق ويب مجانيًا وغير تجاري يستخدم ذكاء اصطناعي لتوليد تصنيع كلامي لأصوات شخصيات خيالية من إعلام. أنشأه باحث في مجال الذكاء الاصطناعي مجهول يُعرف باسم 15، بدأ تطوير هذه التقنية عندما كان فتى غض خلال بحثه الجامعي في معهد ماساتشوستس للتقانة. أتاح التطبيق للمستخدمين جعل شخصيات من لعبة فيديو وبرنامج تلفزيون وفيلم تنطق نصوصًا مخصصة بنبرات عاطفية، أسرع من الزمن الحقيقي.[ا] اشتهرت المنصة بقدرتها على توليد صوت مقنع باستخدام كمية ضئيلة من بيانات التدريب—وقد أشار اسم "15 أيه آي" إلى ادعاء مبتكرها بأن الصوت يمكن نسخه بواسطة 15 ثانية فقط من التسجيل الصوتي، على عكس نماذج التعلم العميق المعاصرة التي كانت تتطلب عادة عشرات الساعات من البيانات الصوتية. وكانت مثالًا مبكرًا لتطبيق ذكاء اصطناعي مولد خلال المراحل الأولية من طفرة الذكاء الاصطناعي.

أُطلق التطبيق في مارس 2020، وذاع صيته على نطاق واسع في أوائل عام 2021 عندما أصبحت مقاطع محتوى تستخدمه ظاهرة فيروسية على منصات التواصل الاجتماعي مثل يوتيوب وإكس. وسرعان ما أصبح شائعًا بين مجتمعات المعجبين على الإنترنت، مثل معجبي ماي ليتل بوني: فرندشيب إز ماجيك وتيم فورتريس 2 وسبونج بوب سكوير بانتس. تميزت الخدمة بدعمها للسياق العاطفي في توليد الكلام باستخدام إيموجيات، والتحكم الدقيق في النطق من خلال نسخ صوتيات، وقدرات متعددة المتحدثين التي سمحت لنموذج واحد بتوليد أصوات شخصيات متنوعة. يُنسب إلى 15 أيه آي أنه أول منصة رئيسية قامت بتعميم تقنيات نسخ الأصوات عبر الذكاء الاصطناعي (تزييف صوتي) ضمن ميم إنترنت وصناعة المحتوى.[1]

ناقش ممثلو تمثيل صوتي ومحترفو الصناعة مزايا 15.ai فيما يخص الإبداع الجماهيري مقابل تأثيره المحتمل على المهنة. ورغم أن العديد من النقاد أشادوا بسهولة الوصول للتطبيق وقدرته على التحكم العاطفي، فقد أشاروا أيضًا إلى وجود قيود تقنية في مجالات مثل خيارات اللحن ودعم اللغات غير الإنجليزية. أثار 15.ai نقاشات حول التبعات الأخلاقية، بما في ذلك مخاوف بشأن بطالة بسبب التقانة للممثلين الصوتيين، والاحتيال الصوتي، والتزييف العميق للمواد الإباحية.

في يناير 2022، أثارت شركة صوت العالم (الإنجليزية: Voiceverse) جدلًا حين اكتُشف أنها استخدمت 15 أيه آي لتوليد مقاطع صوتية دون نسب المصدر، وقامت ببيعها كرموز غير قابلة للاستبدال دون إذن.[2] وصفت جميع وسائل الإعلام هذه الحادثة بأن منصة صوت العالم "سرقت" المقاطع الصوتية من 15.ai.[2] وفي نهاية المطاف، أُزيلت الخدمة من الإنترنت في سبتمبر 2022 بسبب قضايا قانونية تتعلق بالذكاء الاصطناعي. وأعقب إغلاقها ظهور بدائل تجارية مختلفة في السنوات التالية، وقد أقر مؤسسوها بتأثير 15 أيه آي الرائد في مجال التعلم المتعمق.

التاريخ

[عدل | عدل المصدر]

الخلفية

[عدل | عدل المصدر]
مقارنة بين المحاذاة (الانتباهات) بين تاكوترون ونسخة معدلة من تاكوترون

شهد مجال تصنيع الكلام الاصطناعي تحولًا كبيرًا مع إدخال تقنيات التعلم المتعمق. ففي عام 2016، نشرت شركة ديب مايند الورقة البحثية الرائدة ويف نت: نموذج توليدي للصوت الخام، والتي شكّلت نقطة تحول نحو الاعتماد على الشبكات العصبية الاصطناعية في تصنيع الكلام، حيث عرضت جودة صوت غير مسبوقة باستخدام شبكات عصبية التفافية سببية. في السابق، كان التوليف التجميعي — الذي يعتمد على تجميع مقاطع مسجلة مسبقًا من الكلام البشري— هو الأسلوب السائد، لكنه كان غالبًا ما ينتج أصواتًا آلية وغير طبيعية خاصة عند حدود الجمل.[3]

وبعد عامين، قدمت شركة جوجل أيه آي نظام تاكوترون 2 في 2018، الذي أظهر أن الشبكات العصبية يمكنها إنتاج كلام طبيعي للغاية، لكنه كان يتطلب بيانات تدريبية ضخمة—عادةً عشرات الساعات من التسجيلات الصوتية—لتحقيق جودة مقبولة. وعند تدريبه على مجموعات بيانات أصغر، مثل ساعتين من الكلام، تنخفض جودة المخرجات مع بقاء الكلام قابلًا للفهم، أما مع 24 دقيقة فقط من التدريب، فيفشل تاكوترون 2 في إنتاج كلام مفهوم.[4]

وفي نفس العام، ظهر هاي فاي-ججان، وهو مولد خصومي توليدي يُستخدم كـ "فوكودر" حسن من كفاءة إنتاج الموجات الصوتية وقدم صوتًا عالي الدقة،[5] تلاه غلو-تي تي سي، الذي أدخل نهجًا مولدًا قائمًا على التدفق، مما أتاح توليدًا سريعًا ونقلًا لأسلوب الصوت.[6] كما ساهمت شركات التقنية الصينية مثل بايدو وبايت دانس في دفع المجال قدمًا عبر تطوير أطر توليد صوت نصي خاصة بها، رغم أن تفاصيلها التقنية بقيت سرية إلى حد كبير.[7]

التطوير والإصدار والتشغيل

[عدل | عدل المصدر]
[...] الموقع له عدة أهداف. فهو يعمل كدليل على إمكانية إنشاء منصة تسمح لأي شخص بإنتاج محتوى، حتى لو لم يكن لديه القدرة على توظيف مؤدي أصوات لمشاريعه.

كما يُظهر تقدم أبحاثي بطريقة أكثر تفاعلية—فعند استخدامك للنموذج مباشرة، يمكنك اكتشاف أشياء لم أكن أعلم بها بنفسي (مثل جعل الشخصيات تصدر أصوات تنهّد أو أنين بمجرد وضع فواصل بين بعض الأصوات).

كما أنه لا يسمح لي بانتقاء أفضل النتائج فقط لعرضها... التفاعل الحر مع النموذج يتيح للمستخدم الحكم مباشرة على جودة العمل الحالي.

تم ابتكار 15 أيه آي في عام 2016 كمشروع بحثي في مجال التعلم المتعمق على يد مطوّر يُعرف باسم "15" (وكان عمره حينها 18 عامًا[9]) خلال سنته الدراسية الأولى في معهد ماساتشوستس للتقنية ضمن برنامج الفرص البحثية للطلاب الجامعيين.[10] استلهم المطوّر الفكرة من ورقة ويف نت (الإنجليزية: WaveNet) التي نشرتها ديب مايند، واستمر في تطوير النموذج خلال دراسته، تزامنًا مع إصدار جوجل أيه آي لنظام تاكوترون 2 في العام التالي. وبحلول عام 2019، كان المطوّر قد أثبت في MIT قدرته على إعادة إنتاج نتائج ويف نت وتاكوترون 2 باستخدام 75% من بيانات التدريب فقط مقارنةً بما كان مطلوبًا سابقًا.[7] يشير اسم "15" إلى ادعاء المنشئ بأن بالإمكان استنساخ الصوت من مجرد 15 ثانية من البيانات.[11]

وكان المطوّر يخطط في الأصل لمتابعة دراسة الدكتوراه استنادًا إلى أبحاثه الجامعية، لكنه قرر العمل في وادي السيليكون بعد أن تم قبول شركته الناشئة في مسرّعة واي كومبناتور في عام 2019. وبعد مغادرته في أوائل 2020، عاد المطوّر إلى أبحاثه في تصنيع الصوت وطبّقها كـتطبيق ويب. ووفقًا لمنشور له على إكس في عام 2024، بدلاً من استخدام مجموعات بيانات تقليدية مثل إل جي سبيتش التي تحتوي على تسجيلات بسيطة ومسطّحة، بحث عن عينات صوتية أكثر تحديًا يمكنها إظهار قدرة النموذج على التعامل مع أنماط الكلام المعقدة والنبرات العاطفية.[tweet 1]

لعب مشروع "حفظ المهرات" (الإنجليزية: Pony Preservation Project) —وهو مبادرة جماهيرية انطلقت من منتدى /mlp/ على فورتشان المتعلق بـماي ليتل بوني—دورًا محوريًا في التنفيذ. فقد قام المشاركون فيه بقص وضبط وضبط الضوضاء ونسخ وتصنيف العواطف لكل جملة في المسلسل يدويًا. وقد وفّر هذا مجموعة بيانات مثالية لتدريب نموذج التعلم العميق الخاص بـ15.ai.[7]

مثال على تضمين متعدد المتحدثين. تقوم الشبكة العصبية بربط الطوابع الزمنية المتوقعة بسلسلة مضللة من تضمين الكلمات تحتوي على معلومات عن المتحدث.

تم إطلاق 15.ai في مارس 2020 بمجموعة محدودة من الشخصيات، بما في ذلك شخصيات من ماي ليتل بوني: فرندشيب إز ماجيك وتيم فورتريس 2.[12] وقد صُمم النظام ليعمل بكفاءة باستخدام كمية محدودة من بيانات التدريب والتحقق والاختبار—بحيث يتطلب فقط دقائق من الصوت النقي لكل شخصية، على عكس أكثر من 40 ساعة التي تحتاجها النماذج التقليدية المعتمدة على التعلم العميق.[13] وللتغلب على قيود البيانات، استخدم المطوّر تقنيات محددة من زيادة البيانات لتحسين التعميم، مثل إدخال تنويعات متعمّدة في التهجئة، وأنماط علامات الترقيم، وتشويهات النطق أثناء التدريب.[13]

عند الإطلاق، تم تقديم 15.ai كخدمة مجانية[14] وغير تجارية[15] لا يتطلب تسجيل المستخدم للتشغيل،[16] ويتطلب فقط من المستخدمين قبول شروط الاستخدام قبل المتابعة.[17] سُمح للمستخدمين بإنشاء أي محتوى باستخدام الأصوات المولدة بشرطين محددين: يجب عليهم نسب الفضل لـ 15.ai من خلال تضمين رابط الموقع الإلكتروني في أي منشورات أو مقاطع فيديو أو مشاريع تستخدم الصوت المولَّد؛[18] وكان يُحظر عليهم خلط مخرجات 15.ai مع مخرجات أخرى من تقنيات تحويل النص إلى كلام في نفس العمل،[19] لتجنب تحريف قدرات التكنولوجيا.[20]

تمت إضافة المزيد من الأصوات إلى الموقع خلال الأشهر التالية.[21] وجاء تقدم تقني كبير في أواخر عام 2020 مع تنفيذ تضمين كلمات متعدد المتحدثين داخل الشبكة العصبية العميقة، مما مكّن من تدريب عدة أصوات في وقت واحد بدلاً من الحاجة إلى نموذج منفصل لكل شخصية.[7] هذا لم يسمح فقط بالتوسع السريع من ثمانية إلى أكثر من خمسين صوت شخصية،[9] بل مكّن النموذج أيضًا من التعرّف على أنماط عاطفية شائعة بين الشخصيات، حتى عندما كانت بعض المشاعر مفقودة من بيانات التدريب لبعض الشخصيات.[22]

وبحلول مايو 2020، كان الموقع قد خدم أكثر من 4.2 مليون ملف صوتي للمستخدمين.[23] وفي أوائل عام 2021، زادت شهرة التطبيق بعد أن انتشرت مقاطع تمثيلية ونكات ومحتوى جماهيري تم إنشاؤه باستخدام 15.ai على إكس، تيك توك، ريديت، تويتش، فيسبوك، ويوتيوب.[24] وفي ذروته، تكبدت المنصة تكاليف تشغيل بلغت US$12٬000[11] شهريًا بسبب البنية التحتية اللازمة من خدمات أمازون ويب لدعم ملايين عمليات إنشاء الصوت يوميًا؛ وعلى الرغم من تلقيها عروضًا من شركات لاندماج واستحواذ 15 أيه آي وتقنيتها الأساسية، إلا أن الموقع بقي مستقلاً وممولًا من أرباح المطور السابقة من شركته الناشئة،[7] والذي كان يبلغ من العمر حينها 23 عامًا.

جدل منصة "عالم الصوت"

[عدل | عدل المصدر]
ميم ساخر يُمثل رموز غير قابلة للاستبدال. أشار منتقدو عالم الصوت إلى التناقض في بيع حقوق ملكية لأصوات ذكاء اصطناعي بينما قاموا هم أنفسهم بنسخ تقنية 15.ai دون نسب.

في 14 يناير 2022، اندلع جدل بعد اكتشاف أن منصة عالم الصوت (الإنجليزية: Voiceverse NFT) قد نسبت الفضل لنفسها في خطوط صوتية مُولدة من 15 أيه آي دون إذن،[2] وقام ببيعها كرموز غير قابلة للاستبدال (رموز غير قابلة للاستبدال).[2] جاء هذا بعد وقت قصير من تصريح مطور 15.ai في ديسمبر 2021 بأنه لا يهتم بدمج الرموز غير القابلة للاستبدال في عمله.[25] وقد أظهرت سجلات السجل أن عالم الصوت قد أنشأ تسجيلات صوتية لشخصيات من ماي ليتل بوني: فرندشيب إز ماجيك باستخدام 15.ai، ورفعوا نغمتها الصوتية لجعلها غير قابلة للتعرف من الأصوات الأصلية لتسويق منصتهم الخاصة[26]—وذلك في انتهاك صريح لشروط خدمة 15.ai التي تحظر الاستخدام التجاري وتتطلب الإسناد المناسب.[27]

في البداية، زعمت "عالم الصوت" أن منصتها ستسمح لمالكي الرموز غير القابلة للاستبدال بالحصول على حقوق تجارية للأصوات المُولدة بالذكاء الاصطناعي لاستخدامها في إنشاء المحتوى، والدردشات داخل الألعاب، والمكالمات المرئية.[28] وعند مواجهتهم بالأدلة على استيلائهم غير المشروع، ادعت عالم الصوت أن أحد أعضاء فريق التسويق هو من استخدم الصوت دون نسبه بشكل صحيح إلى 15.ai،[29] وشرحوا في خادم ديسكورد الخاص بهم أن فريق التسويق كان في عجلة من أمره لإنشاء عرض تقني للشراكة، فقام باستخدام 15.ai دون انتظار جاهزية تقنيتهم الصوتية الخاصة.[30] تم حذف التغريدة المثيرة للجدل بعد ذلك.[31] وردًا على اعتذارهم، غرد حساب 15 قائلاً: "اذهب واغتصب نفسك"[32]، وهي تغريدة أصبحت شائعة جدًا، حيث حصدت مئات الآلاف من الإعجابات وإعادة التغريد على إكس دعمًا للمطور.[7] وعبر 15 لاحقًا عن إحباطه العميق، كاتبًا: "المجال الكامل لتوليف الأصوات يُساء تمثيله الآن من قبل الدجالين الذين يهتمون فقط بالمال."[19]

تروي بيكر منصة إكس
@TroyBakerVA

أنا أشارك مع @VoiceverseNFT لاستكشاف طرق يمكننا من خلالها سويًا تقديم أدوات جديدة للمبدعين الجدد لصنع أشياء جديدة، والسماح للجميع بفرصة امتلاك والاستثمار في الملكيات الفكرية التي يصنعونها. لدينا جميعًا قصة نرويها. يمكنك أن تكره. أو يمكنك أن تُبدع. فماذا ستختار؟

14 يناير 2022[33]

في أعقاب الجدل المستمر وكشف السرقة الأدبية، واجه الممثل الصوتي تروي بيكر (الذي تعاون مع عالم الصوت) انتقادات لدعمه مشروع رموز غير قابلة للاستبدال[34] ولهجة إعلانه الاستفزازية.[35] وقد وصف بيكر خدمة المنصة بأنها تتيح للأشخاص "إنشاء كتب صوتية مخصصة، أو مقاطع فيديو على يوتيوب، أو محاضرات تعليمية إلكترونية، أو حتى بودكاست باستخدام صوتك المفضل دون متاعب قانونية إضافية"،[17] وهو ما أثار قلق النقاد بشأن احتمالية بطالة بسبب التقانة.[36] لاحقًا، أقر بيكر بأن تغريدته الأصلية التي ختمها بـ"يمكنك أن تكره. أو يمكنك أن تُبدع. فماذا ستختار؟" ربما كانت "استفزازية"،[37] وفي 31 يناير أعلن أنه سينهي شراكته مع "عالم الصوت".[38]

أثار هذا الحدث مخاوف بشأن مشاريع الرموز غير القابلة للاستبدال، إذ لاحظ النقّاد أنها كثيرًا ما تقترن بانتهاكات حقوق الملكية الفكرية وممارسات تجارية مشبوهة.[39] وقد تم توثيق الحادث لاحقًا في «قاعدة بيانات حوادث الذكاء الاصطناعي»، وصُنّف كمثال على "صوت مُركّب بالذكاء الاصطناعي تم بيعه على منصة "عالم الصوت" كرمز غير قابل للاستبدال، وقد أقرّت الشركة بأنه قد تم إنشاؤه باستخدام 15 أيه آي، وهو تطبيق ويب مجاني متخصص في تحويل النص إلى كلام وتوليد الأصوات بالذكاء الاصطناعي، وأُعيد استخدامه دون إسناد مناسب."[40]

كما ظهرت هذه القضية في مشروع الكاتبة وناقدة العملات المشفّرة مولي وايت، والذي وثّق كيف أن إعلان تروي بيكر عن الشراكة بنبرة استفزازية زاد من الانتقادات الموجهة لمبادرة الرموز غير القابلة للاستبدال.[41] وأشارت وايت إلى الطبيعة الغامضة لما تقدّمه "عالم الصوت"، التي وصفت خدمتها بأنها "توفر لك ملكية لصوت فريد في الميتافيرس[42] وأوضحت كيف أن انكشاف استخدامهم لأعمال مسروقة من 15.ai قد أضرّ بمصداقية "عالم الصوت" أكثر فأكثر.[41]

من جهتها، صنّفت المنصة التعليمية الروسية سكيلبوكس صوتي وصانع المحتوى على يوتيوب يونغ يي فكرة الرموز الصوتية غير القابلة للاستبدال لتأثيرها المحتمل على صناعة التمثيل الصوتي،[38] وصرّح في فيديو لاحق على قناته في يوتيوب:

"هذه ليست من الأمور التي يمكن أن تقول فيها المنصة ببساطة 'أوه، عذرًا!'. لقد انتحلوا عمل شخصٍ آخر واستخدموه كوسيلة للترويج الكاذب لجودة منتجاتهم، عبر استخدام ذكاء اصطناعي صوتي أعلى جودة لتسويق شركتهم من أجل مصلحتهم الخاصة."[video 1]

وفي دعوى جماعية رُفعت عام 2024 ضد شركة لوفو، زعمت وثائق المحكمة أن مؤسسي لوفو هم أنفسهم من أنشأ عالم الصوت، حيث ادعى المدّعون أن منصة عالم الصوت "ثبت بالفعل أنها سرقت تقنية من [15 أيه آي]".[43]

توقف النشاط

[عدل | عدل المصدر]

في سبتمبر 2022، تم إيقاف موقع 15.ai عن العمل[44] بسبب مشكلات قانونية تتعلق بـالذكاء الاصطناعي.[7] وقد ألمح المطوّر إلى إمكانية إصدار نسخة مستقبلية تأخذ في الاعتبار المخاوف المتعلقة بحقوق النشر من البداية، إلا أن الموقع لا يزال غير نشط حتى عام 2025.[7]

الميزات

[عدل | عدل المصدر]

كانت المنصة غير تجارية،[15] وتعمل دون الحاجة لتسجيل المستخدمين أو إنشاء حسابات.[16] كان المستخدمون يولدون الكلام عبر إدخال نص واختيار صوت شخصية، مع معلمات اختيارية لمحددات السياق العاطفي والنسخ الصوتي. كل طلب يُنتج ثلاث نسخ صوتية تختلف في النبرة العاطفية، مرتبة حسب درجة مجال الثقة.[45] تضمنت الشخصيات المتاحة عدة شخصيات من تيم فورتريس 2 وماي ليتل بوني: فرندشيب إز ماجيك، بما في ذلك توايلايت سباركل؛ غلادوس، ويتلي، والبرج المدفعي من سلسلة بورتال؛ سبونج بوب سكوير بانتس؛ كيو شوغردست من هوني بوب، رايز كوجيكاوا من بيرسونا 4؛ داريا وجين لين من داريا؛ كارل بروتاناناديليوسكي من فرقة الجوع للمراهقين المائيين؛ ستيفن يونيفرس من ستيفن البطل؛ سانز من أندرتيل؛ مادلين وعدة شخصيات من سيليست؛ الدكتور العاشر من مسلسل دكتور هو؛ ذا ستانلي بيربل؛ وهال 9000 من 2001: ملحمة الفضاء.[46] من بين أكثر من خمسين صوتًا متاحًا، كانت ثلاثون منها لشخصيات من ماي ليتل بوني: فرندشيب إز ماجيك.[21] بعض الشخصيات "الصامتة" مثل تشيل وجوردون فريمان كانت متاحة كنوع من المزاح، حيث تنتج ملفات صوتية صامتة عند إدخال أي نص.[47] شخصيات من أندرتيل وسيليست لم تكن تنطق كلمات، بل تنتج أصوات "بيب" مميزة كما في ألعابها.[48]

توزيعات احتمالية الرموز التعبيرية التي يولدها نموذج ديب موجي. كانت هذه التوزيعات تُعرض ضمن المقاييس التقنية والرسوم في موقع 15 أيه آي[49]

كان 15 أيه آي يولّد الصوت بمعدل 44.1 كيلوهرتز استعيان—وهو أعلى من المعيار 16 كيلو هرتز المستخدم في أغلب أنظمة تحويل النص إلى كلام المبنية على التعلم العميق آنذاك. هذه الدقة الأعلى سمحت بإنتاج صورة طيفية صوتية أكثر تفصيلًا وجودة صوتية أعلى، لكنها جعلت العيوب الصوتية الناتجة عن التركيب أكثر وضوحًا. أفاد المستخدمون بأنهم استخدموا أوداسيتي لتقليل العينات لإخفاء العيوب الاصطناعية، مع انخفاض في الجودة بالمقابل.[13] كانت معالجة الكلام تتم أسرع من الوقت الحقيقي باستخدام شبكات عصبونية عميقة مخصصة وخوارزميات تركيب صوتي متخصصة.[50] رغم أن التكنولوجيا قادرة على إنتاج 10 ثوانٍ من الصوت في أقل من 10 ثوانٍ من وقت المعالجة (أي "أسرع من الوقت الحقيقي")، إلا أن تجربة المستخدم الفعلية كانت تتطلب وقت انتظار أطول بسبب معالجة آلاف الطلبات في آنٍ واحد، وقد يصل الانتظار لأكثر من دقيقة أحيانًا.[51]

الخصائص غير الحتمية للنموذج العميق كانت تنتج اختلافات في الإلقاء، مماثلة لتسجيلات متعددة لممثلين صوتيين.[52] قدم 15 أيه آي مفهوم محددات السياق العاطفي، والتي تتيح للمستخدمين تحديد النبرة العاطفية للنص عبر عبارات موجهة.[53][7] هذه الخاصية اعتمدت على ديب موجي، وهي شبكة تحليل عاطفي طُورت في مختبر الوسائط في معهد ماساتشوستس للتكنولوجيا. تم تقديمه عام 2017، ويعالج تضمينات إيموجي من 1.2 مليار تغريدة بين 2013 و2017 لتحليل المحتوى العاطفي.[54] إذا احتوى الإدخال على سياق إضافي (يفصل بواسطة شريط عمودي |)، يُستخدم النص التالي كالسياق العاطفي.[55] على سبيل المثال، إذا كان الإدخال اليوم هو يوم عظيم!|أنا حزين جدًا.، ستنطق الشخصية الجملة "اليوم هو يوم عظيم!" بعاطفة تتوافق مع من يقول "أنا حزين جدًا".[56] بعض الشخصيات، مثل توايلايت سباركل من مهرتي الصغيرة: الصداقة سحر، كانت تتيح أوضاعًا عاطفية مسبقة مثل "سعيدة".[57]

مثال على تحويل نص "ديسي بيل" إلى كلام، بدءًا من الكتابة الإنجليزية. تُحلل الكلمات إلى رموز أربابيت، ثم تمر عبر متنبئ للنغمة ومنشئ طيف ميل لإنتاج الصوت.

استخدم التطبيق بيانات نطق من واجهة برمجة تطبيقات قواميس أوكسفورد، ويكاموس، وقاموس النطق لجامعة كارنيجي ميلون، والذي يستند إلى أربابيت، وهو نظام نسخ صوتي إنجليزي طُور من قبل داربا في السبعينيات. للكلمات الحديثة أو المصطلحات الشائعة على الإنترنت، استخدم النظام بيانات نطق من مواقع محتوى ينتجه المستخدم مثل ريديت، قاموس إيربن، فورتشان، وجوجل.[18] دعم النظام إدخال رموز أربابيت مباشرة، مما سمح للمستخدمين بتصحيح النطق أو تحديد النطق المرغوب للكلمات متجانسة الكتابة مختلفة النطق. يمكن تفعيل رموز أربابيت عبر وضعها بين أقواس معقوفة، مثل {AA1 R P AH0 B EH2 T} لتحديد نطق كلمة "ARPABET (/ˈɑːrpəˌbɛt/ AR--beht).[22] عرضت الواجهة الكلمات المحللة بألوان مختلفة: أخضر للكلمات الموجودة في قاعدة البيانات، أزرق للرموز المدخلة يدويًا، وأحمر للكلمات التي تم توقع نطقها خوارزميًا.[18]

في الإصدارات الأحدث، قدم 15 أيه آي دعمًا متعدد المتحدثين. بدلًا من تدريب نماذج منفصلة لكل صوت، استخدم نموذجًا موحدًا يتعلم عدة أصوات في آنٍ واحد باستخدام تضمين الكلمات لمتحدثين—وهي تمثيلات عددية تمثل الخصائص الصوتية الفريدة لكل شخصية.[7] جنبًا إلى جنب مع السياق العاطفي المقدم من ديب موجي، سمح هذا التصميم للنموذج بتعلم أنماط مشتركة بين تعبيرات الشخصيات المختلفة، حتى إن لم تتوفر أمثلة تدريبية لبعض الحالات العاطفية لكل شخصية.[22]

حدّت المنصة النص المدخل إلى 200 حرف في كل مرة، لكن يمكن للمستخدمين إنشاء عدة مقاطع لإنشاء خطب أطول.[58] تضمنت الواجهة رسومًا ومقاييس تقنية لتأكيد الجانب البحثي للموقع.[9] اسم خوارزمية 15.ai الأساسية كان ديب ثروت.[59] وبدءًا من النسخة v23 من 15.ai، عرضت الواجهة معلومات تحليل شاملة عن النموذج، بما في ذلك نتائج تحليل الكلمات والعواطف. وتم تبسيط نظام النموذج التدفقي وشبكة خصومية توليدية الهجين للمرمز الصوتي وخفض الضجيج بإزالة مدخلات المعلمات اليدوية.[9]

الاستقبال

[عدل | عدل المصدر]

الاستقبال النقدي

[عدل | عدل المصدر]

وصف النقاد منصة 15 أيه آي بأنها سهلة الاستخدام وقادرة عمومًا على تقليد أصوات الشخصيات بشكل مقنع، مع نتائج متفاوتة أحيانًا. كتبت ناتالي كلايتون من مجلة بي سي غيمر أن صوت سبونج بوب سكوير بانتس تم تقليده بشكل جيد، لكنها أشارت إلى تحديات في محاكاة ذا ستانلي بيربل من لعبة ذا ستانلي بيربل، قائلة: "الخوارزمية ببساطة لا تستطيع التقاط نبرة السخرية الغريبة لراوي ذا ستانلي بيربل". وبالمثل، أشار موقع الألعاب الروسي "رامباجا" إلى أن صوت غلادوس كان مذهلًا لأن "صوتها صُمم في الأصل لمحاكاة الكلام البشري باستخدام الذكاء الاصطناعي"، بينما كان صوت الراوي من مثل ستانلي أقل إقناعًا بسبب نقص بيانات التدريب.[60]

ذكر زاك زويزن من موقع كوتاكو أن "[صديقته] اعتقدت أنه مقطع صوتي جديد مسجل من مؤدية صوت غلادوس". وعلّق كالفن روغونا من موقع الأخبار غاميزو أن بساطة الأداة ساهمت بشكل كبير في انتشارها، إذ مكنت أي شخص على الإنترنت من إنشاء مقاطع صوتية وحفظها بسهولة. كما أبرزت صحيفة يونايتد ديلي نيوز التايوانية قدرة 15.ai على إعادة إنشاء الصوت الميكانيكي لغلادوس، إلى جانب مجموعة متنوعة من خيارات أصوات الشخصيات.[61]

وأفاد موقع ياهو! نيوز تايوان أن "غلادوس في لعبة بورتال يمكنها نطق الجمل بدقة شبه تامة"، لكنه أشار أيضًا إلى أن "هناك الكثير من العيوب، مثل حد الكلمات والتحكم في النبرة، والتي لا تزال تبدو غريبة في بعض العبارات."[62]

وصف كريس بوتون من نشرة بيتسايد الإخبارية الخاصة بالذكاء الاصطناعي قدرة الأداة على تقليد الصوت بـ 15 ثانية فقط من البيانات بأنها "مخيفة"، لكنه أبدى إعجابه بالتقنية وراءها. أما روبن لامورليت من المجلة الفرنسية كلوبيك، فقد وصف التكنولوجيا بأنها "مسلية بشكل شيطاني"، ولاحظ كيف امتلأت منصات تويتر ويوتيوب بمحتوى إبداعي من المستخدمين الذين جربوا الأداة.[63]

ظهرت قدرات المنصة على توليد الأصوات بشكل منتظم على موقع إكوستريا دايلي، وهو موقع معجبين مخصص لبرنامج ماي ليتل بوني: فرندشيب إز ماجيك وأجياله الأخرى، حيث نُشرت تحديثات موثقة، وأعمال معجبين، وإضافات لأصوات شخصيات جديدة. وفي منشور يعرّف بإضافات شخصيات جديدة في 15.ai، كتب مؤسس إكويستريا ديلي شون سكوتيلارو —المعروف أيضًا باسم "سيثيستو" على الإنترنت— أن "بعض الأصوات ليست رائعة بسبب قلة العينات المتوفرة، لكن العديد منها ما يزال مثيرًا للإعجاب." كما وثّق موقع المعجبين الصيني إكويسترا سي إن تطور 15 أيه آي، مسلطًا الضوء على تحديثاته المختلفة، رغم انتقاده لبعض الأخطاء البرمجية وأوقات الانتظار الطويلة في قائمة الانتظار.[64]

كما وجد العديد من النقاد الآخرين أن حد الكلمات، وخيارات النبرة، والطبيعة الحصرية للغة الإنجليزية في التطبيق أمور غير مرضية تمامًا. رأى بيتر بالترج من موقع أخبار أبطال الأنمي الخارقين المهتم بأخبار الأنمي والأبطال الخارقين أن "توليف الصوت تطور إلى حد يصعب فيه تمييز بعض المحاولات المكلفة عن الكلام البشري الحقيقي"، لكنه أضاف أن "في بعض النواحي، لا تزال أصوات مايكروسوفت المحوسبة أكثر تقدمًا من ذلك. كان بالإمكان التأثير على نبرة الأصوات باستخدام رموز خاصة، وكذلك تغيير طبقته الصوتية بحرية. أما مع 15 أيه آي، فأنت تحت رحمة النبرات العشوائية التي تحصل عليها."

وعلى النقيض، أشادت لورين مورتون من موقع حجر، ورقة، بندقية بعمق التحكم في النطق — "إذا كنت مستعدًا للغوص في التفاصيل الدقيقة." وبالمثل، كتب يوجينيو موتو من موقع الأخبار الإسباني Qore.com أن "المستخدمين الأكثر خبرة يمكنهم تغيير معايير مثل التأكيد أو النبرة."[65]

سلط تاكايوكي فوروشيما من موقع دين فامي نيكو قيمر الياباني الضوء على "النطق السلس"، ولاحظ يوكي كوروساوا من موقع أوتوماتون "غنى التعبير العاطفي" كميزة بارزة؛ ولفت كلا المؤلفين اليابانيين الانتباه إلى غياب دعم اللغة اليابانية.[66]

  • كوروساوا 2021: "もうひとつ15.aiの大きな特徴として挙げられるのが、豊かな感情表現だ" (الترجمة: "ميزة أخرى كبيرة في 15 أيه آي هي التعبير العاطفي الغني.")
  • كوروساوا 2021: "英語版ボイスのみなので注意" (الترجمة: "يرجى ملاحظة أن هذه نسخة بصوت إنجليزي فقط.")

أشار رينان دو برادو من موقع أخبار الألعاب البرازيلي أركادي وخوسيه فيلالوبوس من موقع الألعاب الإسباني لاب سي فور إلى أنه رغم قدرة المستخدمين على خلق نتائج مضحكة بالبرتغالية والإسبانية على التوالي، فإن الأداء الأفضل كان في اللغة الإنجليزية.[67]

وصف موقع أخبار الألعاب الصيني قيمر سكاي التطبيق بأنه "مثير للاهتمام"، لكنه انتقد حد الكلمات للنص ونقص التنغيم.[68]

كتب فرانك بارك من موقع ألعاب الفيديو الكوري الجنوبي زونتاتا أن "الشيء المدهش في 15.ai هو أنه بالنسبة لبعض الشخصيات، هناك حوالي 30 ثانية فقط من البيانات، لكنها تحقق دقة نطق تقارب 100%".[69]

علّق أستاذ تعلم الآلة يونغكيانغ لي في مدونته أن التطبيق ما زال مجانيًا رغم وجود 5,000 مستخدم يولدون أصواتًا في وقت واحد عند كتابة التدوينة.[70]

ذكر ماركو كوكميلو من موقع الألعاب والثقافة الشعبية الجنوب أفريقي غليتشيد أنه بالرغم من حد الـ 200 حرف، فإن النتائج "أدهشته" عند اختباره مع صوت غلادوس.[71] وكتب ألفارو إيبانيز من منشور التكنولوجيا الإسباني ميكروسيرفوس أنه وجد إيقاع الأصوات المولدة من الذكاء الاصطناعي مثيرًا للاهتمام، مشيرًا إلى أن النظام يبدو أنه يكيّف أدائه بناءً على المعنى المقصود من المحتوى.[72]

قدمت المنشورات التقنية ووسائل الإعلام المتخصصة في الذكاء الاصطناعي تحليلات أعمق لقدرات 15.ai وقيودها مقارنة بتقنيات تحويل النص إلى كلام الأخرى في ذلك الوقت.[73] أشار ريونالدي تشاندراسيتا من نشرة الذكاء الاصطناعي نحو علم البيانات إلى أن نماذج الصوت المدربة على مجموعات بيانات أكبر تنتج نواتج أكثر إقناعًا مع صياغة أفضل وتوقفات طبيعية، لا سيما للنصوص الطويلة.[53] وأبرز باي فنغ من وسائل الإعلام التقنية الصينية شين زي يوان على منصة كيو كيو الإنجاز التقني لجودة ناتج 15.ai العالية (بمعدل استعيان 44.1 كيلو هرتز) رغم استخدام بيانات تدريب محدودة، ملاحظًا أن هذه جودة أعلى بكثير من تطبيقات تحويل النص إلى كلام بالتعلم العميق التقليدية التي تستخدم معدل استعيان 16 كيلو هرتز. كما أشار الموقع إلى أن بعض أخطاء النطق حدثت بسبب قلة بيانات التدريب، وهو أمر مفهوم بالنظر إلى أن النماذج التقليدية كانت تتطلب عادةً 40 ساعة تدريب أو أكثر.

  • فينغ 2020: "ملفات الصوت التي يولدها هذا الأداة لها معدل أخذ عينات 44100 هرتز، بينما تستخدم معظم تطبيقات تحويل النص إلى كلام المعتمدة على التعلم العميق معدل أخذ عينات 16000 هرتز. لذلك، فإن الصوت الناتج سيكون له طيف صوتي أكثر تفصيلاً (صوت بجودة أعلى)، ولكن العيوب ستكون أكثر وضوحًا."
  • فينغ 2020: "بالطبع، النموذج المدرب على مجموعة بيانات صغيرة كهذه يحتوي على عيوب، وقد تُلفظ بعض الكلمات بشكل غير دقيق. في الواقع، هذا مفهوم بسهولة، حتى الإنسان قد لا يستطيع لفظ الكلمات الجديدة بدقة عند مواجهتها. عادة ما تتطلب النماذج التقليدية العميقة أكثر من 40 ساعة من البيانات، لذا فإن معدل الخطأ يكون أقل."
  • بالمثل، لاحظ بارث ماهيندرا من نشرة الذكاء الاصطناعي أيه آي ديلي أنه بينما "يقوم النظام بعمل جيد في تقليد معظم الكلمات الأساسية بدقة"، فإنه يواجه صعوبة مع المصطلحات الأكثر تعقيدًا، مشيرًا إلى أن الشخصيات "تخرب تمامًا نطق بعض الكلمات".
  • وصف جي يونيو من موقع أخبار التقنية الصيني نت إيز التكنولوجيا وراء 15 أيه آي بأنها "فعالة بشكل ملحوظ"، حيث تتطلب بيانات قليلة فقط لاستنساخ العديد من الأصوات بدقة مع الحفاظ على الفروق العاطفية والتنغيم الطبيعي. لكنه أشار أيضًا إلى محدوديات، ملاحظًا أن التعبير العاطفي "محايد" نسبيًا وأن "المشاعر القصوى" لا يمكن تركيبها بشكل صحيح، مما يجعلها أقل ملاءمة للتطبيقات غير مناسب للعمل.
  • كما ذكر جي أن العديد من فيديوهات تزييف عميق تتطلب من المنشئين استخراج وتحرير ساعات من المحتوى الأصلي لنتائج قصيرة جدًا، بينما يمكن لـ 15.ai تحقيق تأثيرات مماثلة أو أفضل مع بضع عشرات من دقائق بيانات التدريب لكل شخصية، رغم أن مشاكل أداء الخادم غالبًا ما تعني أن التركيب قد يستغرق أكثر من دقيقة.

ردود فعل الممثلين الصوتيين للشخصيات

[عدل | عدل المصدر]
مقابلة مع إيلين ماكلين (مؤدية صوت غلادوس في سلسلة بورتال) وجون باتريك لووري (مؤدي صوت القناص في تيم فورتريس 2) على بودكاست The VŌC عام 2021 حول آراءهم في 15 أيه آي وتقنية تركيب الصوت بالذكاء الاصطناعي.

شارك بعض الممثلين الصوتيين الذين ظهرت شخصياتهم على 15.ai آرائهم علنًا حول المنصة. في مقابلة عام 2021 على بودكاست تمثيل الصوت في ألعاب الفيديو The VŌC، شرح جون باتريك لووري —مؤدي صوت القناص في تيم فورتريس 2— أنه اكتشف 15 أيه آي عندما عرضت عليه متدربة مسرحية قصيرة أنشأتها باستخدام أصوات مولدة بالذكاء الاصطناعي للقناص والعميل المتخفي من اللعبة. علق لووري قائلاً:

"لا تزال التكنولوجيا بحاجة لوقت طويل قبل أن تصدق حقًا أن هذه مجرد أصوات بشرية، لكنني كنت مندهشًا من مدى ما يمكن لـ 15.ai فعله. بالتأكيد لا تحصل على الأداء الذي تحصل عليه من شخص فعلي قام بتحليل المشهد، [...] لكن أعتقد أنه كمصدر للمعجبين —لمن يريدون تجميع المود وأشياء من هذا القبيل— قد يكون من الممتع للمعجبين استخدام أصوات شخصيات يحبونها."

وأشار إلى تشبيه بالموسيقى قائلاً:

"إذا أردت صوت الجوقة، وأردت صوت الأوركسترا، وكان لديك المال، ستوظف جوقة وأوركسترا. وإذا لم يكن لديك المال، لديك شيء يبدو جيدًا إلى حد ما؛ لكنه ليس مثل الجوقة والأوركسترا."

في بث مباشر عام 2021 على قناته في تويتش، استمع نيت—الممثل الصوتي لشخصية تيم فورتريس 2 من اللعبة—إلى إعادة إنشاء صوت شخصيته بواسطة الذكاء الاصطناعي. وصف الانطباع بأنه "مثير للاهتمام" ولاحظ "هناك بعض الأشياء في الصوت".

مخاوف أخلاقية

[عدل | عدل المصدر]

أبدى بعض الممثلين الصوتيين ردود فعل متباينة تجاه قدرات 15.ai. بينما أقر بعض محترفي الصناعة بالابتكار التقني، أبدى آخرون مخاوف بشأن تداعيات التكنولوجيا على مهنتهم.[74] عندما أعلن الممثل الصوتي تروي بيكر عن شراكته مع منصة صوت العالم، التي استغلت تقنية 15 أيه آي بدون إذن، أثار ذلك جدلاً واسعًا في صناعة التمثيل الصوتي.[75] أبدى النقاد مخاوف من احتمال حدوث بطالة بسبب التقانة للممثلين الصوتيين،[76] خطر انتحال الصوت، واحتمالية التزييف العميق في المواد الإباحية.[52] لاحظت روبي إينس من كوتاكو أن "هذا الأمر قد يؤدي إلى فقدان الممثلين لوظائفهم إذ يمكن ببساطة استخدام صوتهم الاصطناعي بدلاً من العمل معهم ودفع أجرهم."[17] في تغطيتها لجدل صوت العالم، أثارت إيدي وي كي من نقطة تفتيش الألعاب القلق من أن "مثل هذه التكنولوجيا قد تدفع الممثلين الصوتيين لفقدان عملهم إذا أصبح استخدام أصوات الذكاء الاصطناعي أسهل وأرخص من العمل المباشر مع الممثل." بينما قيدت 15 أيه آي نطاقها على الشخصيات الخيالية ولم تعيد إنتاج أصوات أشخاص حقيقيين أو مشاهير،[18] أشار عالم الحاسوب أندرو نج إلى أن تقنية مماثلة يمكن استخدامها لذلك، بما في ذلك لأغراض ضارة. في تقييمه لعام 2020 لـ 15 أيه آي، كتب:

"استنساخ الصوت قد يكون منتجًا للغاية. في السينما الأمريكية، قد يغير استخدام الممثلين الافتراضيين. في الرسوم المتحركة والكتب الصوتية، قد يمكن الممثلين الصوتيين من المشاركة في المزيد من الإنتاجات. في التعليم عبر الإنترنت، قد ينتبه الأطفال أكثر للدروس المقدمة بأصوات شخصيات مفضلة. وكم من منتجي فيديوهات اليوتيوب يحبون أن يروي مورغان فريمان الاصطناعي نصوصهم؟"

وعند مناقشة المخاطر المحتملة، أضاف:

"...لكن تركيب صوت ممثل بشري بدون موافقته يُعتبر غير أخلاقي وربما غير قانوني. وهذه التكنولوجيا ستكون جاذبة جدًا لمن يصنعون التزييف العميق، الذين قد يجمعون تسجيلات من الشبكات الاجتماعية لانتحال هوية أشخاص خاصين."

كانت 15 أيه آي من الرواد الأوائل في مجال التزييف الصوتي العميق، مما أدى إلى ظهور ميمات تعتمد على تركيب الكلام بالذكاء الاصطناعي خلال المراحل الأولى من طفرة الذكاء الاصطناعي في عام 2020. تُنسب إلى 15 أيه آي كونها أول منصة شعبية تعمّم استنساخ الصوت بالذكاء الاصطناعي في ميم الإنترنت وإنشاء المحتوى، خاصةً من خلال قدرتها على توليد أصوات شخصيات مقنعة في الوقت الحقيقي دون الحاجة إلى خبرة تقنية واسعة. كان تأثير المنصة ملحوظًا بشكل خاص في مجتمعات المعجبين، بما في ذلك مجتمعات ماي ليتل بوني: فرندشيب إز ماجيك، وبورتال، وتيم فورتريس 2، وسبونج بوب سكوير بانتس، حيث مكنت من إنشاء محتوى فيروسي حقق ملايين المشاهدات عبر منصات التواصل الاجتماعي مثل إكس ويوتيوب. كما استخدم منشئو محتوى Team Fortress 2 المنصة لإنتاج ميمات قصيرة ورسوم متحركة سردية معقدة باستخدام صانع الأفلام المصدر. شملت إبداعات المعجبين مشاهد تمثيلية ورسوم متحركة جديدة مثل فيديو فريق القلعة 2 الشهير اعتراف الجاسوس، ومحتوى مشترك مثل عرض ليانا روبرت، كاتبة غيم إنفورمر، الذي دمج حوارات من بورتال وماي إفكت في تغطيتها للمنصة، وإعادة إنشاء فيديوهات فيروساتية مثل محاكاة متجر سيارات سيارات بيج بيل هيلز، وتكييفات أدب المعجبين باستخدام أصوات شخصيات مولدة بالذكاء الاصطناعي مثل الحلقة المعجبين المؤلفة الإعفاءات الضريبية بطول 17 دقيقة من الصداقة سحر، وفيديوهات موسيقية وتركيبات موسيقية جديدة مثل ريمكس فريق القلعة 2 بعنوان بوتيس هاردباس، ومحتوى حيث تتلو الشخصيات نهمة. نالت بعض إبداعات المعجبين اهتمامًا واسعًا مثل تعديل فيروسي استبدل ظهور دونالد ترامب في وحيد في المنزل 2: ضائع في نيويورك بصوت مولد بالذكاء الاصطناعي لشخصية من تيم فورتريس 2، وظهر ذلك في تقرير على قناة سي إن إن النهارية في يناير 2021. كما دمج بعض المستخدمين تركيب صوت 15.ai مع برنامج الأوامر الصوتية فويس أتاك (الإنجليزية: VoiceAttack) لإنشاء مساعدين شخصيين.

لوحظ تأثيرها في السنوات التي تلت توقفها، مع ظهور عدة بدائل تجارية لسد الفراغ، مثل إلفن لابس التي تستخدم "11 أيه آي" كاسم قانوني لنطاقها الإلكتروني، وسبيتشيفاي. وأقرت شركات الذكاء الاصطناعي الصوتي المعاصر بدور 15.ai الرائد، حيث وصفت شركة بلاي إتش تي الناشئة والممولة من واي كومبناتور إطلاق 15 أيه آي بأنه "اختراق في مجال تحويل النص إلى كلام وتركيب الصوت". وأشاد كليف ويتنزمان، مؤسس ومدير عام سبيتشيفاي، بـ 15 أيه آي لجعل استنساخ الصوت بالذكاء الاصطناعي شائعًا في إنشاء المحتوى من خلال كونها الأولى التي تضم شخصيات معروفة من مجتمعات المعجبين. وكتب ماتي ستانيسزفسكي، المؤسس المشارك والمدير التنفيذي لإلفن لابس، أن 15.ai كانت محورية في مجال تعلم متعمق.

في مؤتمرات بروني، نوقشت 15 أيه آي في العروض التقديمية حول تقاطع ماي ليتل بوني: فرندشيب إز ماجيك والذكاء الاصطناعي.

قبل إغلاقها، أسست 15 أيه آي عدة سوابق تقنية أثرت على التطورات اللاحقة في تركيب الصوت بالذكاء الاصطناعي. أظهرت دمجها للإيموجي لتحليل العواطف جدوى إدخال التوليد الكلامي الواعي بالعواطف، بينما وضع دعمها لنظام أربابيت للنسخ الصوتي معيارًا للتحكم الدقيق بالنطق في أدوات تركيب الصوت الموجهة للجمهور. وكان نموذج المتحدثين المتعدد الموحد في المنصة، الذي أتاح التدريب المتزامن لأصوات شخصيات متنوعة، مؤثرًا بشكل خاص. هذا النهج سمح للنظام بالتعرف على أنماط العواطف عبر أصوات مختلفة حتى عندما تكون بعض العواطف غائبة في مجموعات تدريب شخصية معينة؛ فمثلًا إذا كانت شخصية ما تحتوي على أمثلة للحديث الفرح ولكن لا توجد أمثلة للغضب، وشخصية أخرى بها أمثلة للغضب ولكن لا توجد أمثلة للفرح، يمكن للنظام تعلم توليد كلتا العاطفتين لكلا الشخصيتين من خلال فهم الأنماط المشتركة لتأثير العواطف على الكلام.

كما قدمت 15.ai مساهمة رئيسية في تقليل متطلبات بيانات التدريب لتركيب الصوت. الأنظمة السابقة مثل تاكوترون من جوجل أيه آي وفاست سبيتش من أبحاث مايكروسوفت كانت تحتاج لعشرات الساعات من الصوت لإنتاج نتائج مقبولة، وكانت تفشل في توليد كلام مفهوم بأقل من 24 دقيقة من بيانات التدريب. على النقيض، أثبتت 15.ai قدرتها على توليد الكلام باستخدام بيانات تدريب أقل بكثير، ويشير اسم "15 أيه آي" إلى ادعاء منشئها بأنه يمكن استنساخ صوت باستخدام 15 ثانية فقط من البيانات. أثرت هذه الكفاءة في استخدام البيانات على التطورات اللاحقة في تقنية تركيب الصوت بالذكاء الاصطناعي، حيث أصبح معيار 15 ثانية نقطة مرجعية للأنظمة الصوتية اللاحقة. وقد أكدت شركة أوبن أيه آي في 2024 صحة الادعاء الأصلي بأن 15 ثانية فقط من البيانات تكفي لاستنساخ صوت إنسان.

انظر أيضًا

[عدل | عدل المصدر]

الحواشي التوضيحية

[عدل | عدل المصدر]
  1. المقصود بمصطلح "أسرع من الزمن الحقيقي" في تصنيع الكلام، هو أن النظام يمكنه توليد الصوت بشكل أسرع من مدة الكلام الفعلية—على سبيل المثال، توليد 10 ثوانٍ من الكلام في أقل من 10 ثوانٍ يُعد أسرع من الزمن الحقيقي.

المصادر

[عدل | عدل المصدر]

المراجع

[عدل | عدل المصدر]
    • Cocomello 2021: "ولكن في ذلك الوقت، إذا أردت إنشاء حوار خاص بك، كان الأمر يتطلب طبقات من التحسينات الصوتية والتعديلات. لحسن الحظ، تطور العالم، وبفضل تطبيق 15.ai، أصبح بإمكاننا جعل [...] الشخصيات الشهيرة تقول ما نريده"
    • MrSun 2021: 大家是否都曾經想像過,假如能讓自己喜歡的遊戲或是動畫角色說出自己想聽的話,不論是名字、惡搞或是經典名言,都是不少人的夢想吧。不過來到 2021 年,現在這種夢想不再是想想而已,因為有一個網站通過 AI 生成的技術,(قالب:Translation هل سبق لك أن تخيلت كيف سيكون الأمر لو أن شخصيات ألعابك أو رسومك المتحركة المفضلة تستطيع قول ما تريد سماعه؟ سواء كانت أسماء أو محاكاة ساخرة أو اقتباسات كلاسيكية، فهذا حلم للكثيرين. لكن مع دخول عام 2021، لم يعد هذا الحلم مجرد خيال، لأن هناك موقعًا يستخدم تقنية الذكاء الاصطناعي لتوليد ذلك.)
    • Anirudh VK 2023: "بينما كانت ميمات الصوت المعتمدة على الذكاء الاصطناعي موجودة بشكل ما منذ إطلاق '15.ai' عام 2020، [...]"
    • Wright 2023: "كانت أدوات الذكاء الاصطناعي الصوتية المُستخدمة لإنشاء "تزييفات صوتية" موجودة منذ سنوات بأشكال مختلفة، وكان 15.ai مثالًا بارزًا."
    • Weitzman 2023: "اكتسب شهرة لأنه كان أول منصة ذكاء اصطناعي صوتية تضم مجموعة من الشخصيات الخيالية من مصادر إعلامية متنوعة"
    • Temitope 2024: "خلال هذه الفترة، يُنسب إلى 15.ai الفضل في تعميم تقنية نسخ الأصوات بالذكاء الاصطناعي—والتي غالبًا ما يُشار إليها باسم 'التزييفات الصوتية'—ضمن الميمات والمحتوى الفيروسي والإعلام المُنتَج من قِبل المعجبين."
    • Abisola 2025: "يعزو الكثيرون إلى 15.ai كونه أول منصة تحويل نص إلى كلام رئيسية جعلت التزييفات الصوتية تنتشر بشكل فيروسي حقًا."
  1. 1 2 3 4 [...]
  2. Barakat, Turk & Demiroglu 2024.
  3. Google 2018
  4. Kong, Kim & Bae 2020.
  5. Kim et al. 2020.
  6. 1 2 3 4 5 6 7 8 9 10 Temitope 2024.
  7. Hacker News 2022
  8. 1 2 3 4 Abisola 2025.
  9. Chandraseta 2021
    Li 2021
    Ji 2021
    Temitope 2024.
  10. 1 2 Temitope 2024
    Abisola 2025.
  11. Ng 2020
    Mahendra 2020.
  12. 1 2 3 Feng 2020.
    • Clayton 2021: "ولكن بفضل أداة مجانية عبر الإنترنت تعتمد على التعلم الآلي"
    • Oxton 2021: "Благодаря бесплатному онлайн-инструменту, основанному на машинном обучении" ("أداة مجانية عبر الإنترنت تعتمد على التعلم الآلي")
    • Paltridge 2021: "إنه 15.ai، موقع مجاني يمكن لأي شخص استخدامه."
    • Li 2021: "该网站的访问量为在线任务差不多5000以上,而且目前完全免费" ("عدد زيارات الموقع يزيد عن 5000 في وقت واحد، وهو مجاني تمامًا حاليًا.")
    • Lam 2022: "15.ai، تطبيق ويب مجاني متخصص في تحويل النص إلى كلام وتوليد الصوت بالذكاء الاصطناعي"
    • Toh 2022: "خدمة تحويل النص إلى كلام المجانية والشهيرة، 15.ai"
    • Innes 2022: "15.ai، ذكاء اصطناعي مجاني يمكنه استنساخ الأصوات بدقة"
  13. 1 2
    • Williams 2022: "[...] 15.ai – خدمة تحويل نص إلى كلام غير تجارية."
    • Wright 2022: "[...] 15.ai، خدمة تحويل نص إلى كلام غير تجارية."
    • Innes 2022: "عند استخدام مشروع 15.ai، يظهر تنبيه ينص على أن المشروع غير مخصص للاستخدام التجاري"
  14. 1 2
    • Villalobos 2021: "كل ما عليك فعله هو الدخول، واختيار GlaDOS من قائمة الشخصيات المتاحة،"
    • do Prado 2021: "لاستخدام البرنامج، الأمر بسيط جدًا، ادخله من خلال النقر هنا، ومن شريط الخيارات اختر اللعبة/الرسوم المتحركة/المسلسل الذي تريد الصوت منه، اختر الشخصية واكتب النص." ()
  15. 1 2 3 Innes 2022.
  16. 1 2 3 4 Kurosawa 2021.
  17. 1 2 Beckwith 2022.
  18. "حول الموقع". 15.ai (الموقع الرسمي). 2 مارس 2020. مؤرشف من الأصل في 2020-03-03. اطلع عليه بتاريخ 2024-12-23.
  19. 1 2 Scotellaro 2020b.
  20. 1 2 3 Kurosawa 2021
    Temitope 2024.
  21. Mahendra 2020.
  22. Feng 2020
    Ruppert 2021
    Rugona 2021
    Abisola 2025.
  23. Lopez 2022
    Innes 2022
    Anikó 2022
    Piletsky 2022.
  24. Phillips 2022
    Innes 2022
    Toh 2022
    W-K 2022
    Muropaketti 2022.
  25. Innes 2022
    Коэн 2022
    Myrén 2022.
  26. Toh 2022
    Kar 2022.
  27. Phillips 2022
    Myrén 2022.
  28. Коэн 2022: "كما أوضحوا في ديسكورد، كان فريق التسويق في عجلة من أمره لإنشاء عرض توضيحي للشراكة، فلم ينتظر إنشاء صوت مناسب وأخذوه من 15.ai." (قالب:Translation)
  29. Piletsky 2022
    Skorich 2022.
  30. Wright 2022
    Groth-Anderson 2022
    Myrén 2022.
  31. Innes 2022
    Enriquez 2022.
  32. Lopez 2022.
  33. White 2022
    W-K 2022.
  34. W-K 2022
    Innes 2022.
  35. Wright 2022
    White 2022
    Carcasole 2022
    Enriquez 2022.
  36. 1 2 Parker 2022.
  37. Коэн 2022
    Baylos 2022.
  38. Lam 2022.
  39. 1 2 White 2022.
  40. White 2022
    Cabibi-Wilkin 2022.
  41. Paul Lehrman and Linnea Sage, et al. v. LOVO, Inc., No. 1:24-cv-03770, 38 (S.D.N.Y. 2024) (“Separately, VoiceVerse has already been found to have stolen technology from another company. See Ule Lopez, WCCF Tech, "Voiceverse NFT Service Reportedly Uses Stolen Technology from 15ai," (Jan. 16, 2022), https://wccftech.com/voiceverse-nft-service-usesstolen-technology-from-15ai/.”).
  42. Staniszewski 2024
    Gigonway 2023.
  43. Ibáñez 2022
    Menor 2024.
  44. Zwiezen 2021
    Clayton 2021
    Morton 2021
    Ruppert 2021
    Villalobos 2021
    Furushima 2021
    Kurosawa 2021
    Cocomello 2021
    Rugona 2021
    Lamorlette 2021.
  45. Morton 2021
    遊戲 2021
    Rugona 2021.
  46. Rugona 2021.
  47. Ibáñez 2022
    Abisola 2025.
  48. Feng 2020
    Chandraseta 2021.
  49. Chandraseta 2021
    Ji 2021
    Lamorlette 2021.
  50. 1 2 Menor 2024.
  51. 1 2 Chandraseta 2021.
  52. Kurosawa 2021
    Button 2021.
  53. Chandraseta 2021: "بإضافة '|' بعد الجملة الأصلية وتوفير جملة إضافية، يمكننا التحكم بالعاطفة التي تُنطق بها الجملة الأصلية. أي أن 'text_1|text_2' ستنتج عبارة صوتية لـ text_1 مع العاطفة الموجودة في text_2."
  54. Chandraseta 2021: "لأنه يمكن إجبار النظام على توليد بيانات غير مسبوقة، مثل قول 'اليوم هو يوم عظيم!' بعاطفة حزينة أو غاضبة."
  55. Mahendra 2020: "على سبيل المثال، توايلايت سباركل من ماي ليتل بوني تتيح إخراج النص بنمط سعيد."
  56. Cocomello 2021
    Ruppert 2021.
  57. Ibáñez 2022.
  58. Oxton 2021: "بعض الشخصيات تبدو أفضل من غيرها. أداء غلادوس هو الأفضل، لأن صوتها صُمم أساسًا لمحاكاة الكلام البشري بالذكاء الاصطناعي. للأسف، لا تكفي جميع حوارات الراوي من مثل ستانلي لتعليم الذكاء الاصطناعي تقليد النبرة الغريبة لكيفن برايتنغ."
  59. 遊戲 2021: "يوفر موقع 15.ai حاليًا الكثير من مصادر الصوت، [...] بالإضافة إلى لعبة «بورتال»، يدعم الموقع حاليًا أيضًا العديد من أصوات الشخصيات من الألعاب والأفلام والرسوم المتحركة."
  60. MrSun 2021: "حتى غلادوس في «بورتال» يمكنها تلاوة أي جملة بدقة. بالطبع أشار الموقع إلى أن هناك عيوبًا كثيرة، مثل حد الكلمات والتحكم في النبرة الذي لا يزال غريبًا قليلاً في بعض العبارات. لكن إن كنت مستعدًا لقضاء الوقت، يمكنك إنشاء محتوى ممتع كما فعل المستخدمون الآخرون."
  61. Lamorlette 2021: "يمكنك أن تجد على هذه الشبكات الاجتماعية العديد من الأمثلة لما يمكن تحقيقه من خلال الجمع بين عقل مبدع وتكنولوجيا فعالة ومسلية بشكل شيطاني."
  62. www.equestriacn.com 2021.
  63. Moto 2021: "في الواقع، يمكن للمستخدمين المتقدمين تغيير بعض المعايير مثل النبرة أو التأكيد."
  64. Furushima 2021: "لا يدعم الإدخال الياباني، لكن حتى مع الإدخال باستخدام الحروف اللاتينية (رومجي)، يصدر نطق قريب إلى حد ما. 15.ai هي خدمة تحويل نص إلى كلام، لكن ما يجعلها جديرة بالملاحظة هو نطقها السلس وقدرتها على إعادة إنتاج أصوات الشخصيات في الألعاب."
    • do Prado 2021: "من الواضح أن البرنامج يعمل باللغة الإنجليزية، لكن يمكنك توليد جمل مربكة ومضحكة جدًا بالبرتغالية، مثل تلك الميمات التي تستخدم أصواتًا بلغات أخرى تتحدث البرتغالية."
    • Villalobos 2021: "في هذا الصدد، خلال الساعات الأخيرة أصبح موقع إلكتروني شائعًا يحاكي صوت GLaDOS ليقول كل الكلمات التي تريدها، طالما كانت بالإنجليزية، رغم أنه يمكنك كتابة شيء بالإسبانية وسيحاول نطقه، لكنه لن يفعل ذلك بشكل صحيح."
    • GamerSky 2021: "على الرغم من أن صوت الذكاء الاصطناعي يفتقر إلى بعض التنغيم، إلا أن التأثير لا يزال مثيرًا للاهتمام." (قالب:Translation "Although the AI's voice lacks some intonation, the effect is still interesting.")
    • GamerSky 2021: "حاليًا تقدم 15.ai خيارات شخصيات قليلة نسبيًا، وبسبب حد عدد كلمات النص، فإن الصوت المولد قصير نسبيًا." (قالب:Translation "Currently, 15.ai provides relatively few character options, and due to the word limit of the text, the generated voice is relatively short.")
  65. Park 2021: "ما يدهش في 15.ai هو أن البيانات قريبة من 30 ثانية، لكنها تحقق دقة نطق تقارب 100%." (قالب:Translation "[...] what's amazing about 15.ai is that the data is close to 30 seconds long, but it achieves pronunciation accuracy close to 100%.")
  66. Li 2021: "عدد الطلبات على الموقع تجاوز 5000 مهمة، وهو لا يزال مجانيًا تمامًا حتى الآن." (قالب:Translation: "The number of requests to the website is more than 5,000 tasks, and it is still currently completely free.")
  67. Cocomello 2021.
  68. Ibáñez 2022: "وجدت شخصيًا أن التوقفات والإيقاع مثيرتان للاهتمام، ومن الواضح أن النتيجة تُفسر بحسب المحتوى النصي وما يحاول أن ينقله." (قالب:Translation "Personally, I found the pauses and rhythm interesting, and that it is certainly noticeable that depending on the content of the text, the result is 'interpreted' according to what is being trying to convey.")
  69. Feng 2020
    Mahendra 2020
    Ji 2021.
  70. Parker 2022
    Temitope 2024.
  71. Parker 2022
    Skorich 2022
    Piletsky 2022
    Enriquez 2022.
  72. Innes 2022
    Kar 2022.

تغريدات

[عدل | عدل المصدر]
  1. @fifteenai (7 ديسمبر 2024). "The past and future of 15.ai" (تغريدة). مؤرشف من الأصل في 2024-12-08. اطلع عليه بتاريخ 2024-12-19 عبر X (formerly Twitter).

مقاطع فيديو

[عدل | عدل المصدر]
  1. "Troy Baker Faces Mass Backlash For Supporting Shady AI Voice NFTs With Company That Has Stolen Work". يوتيوب. 14 يناير 2022. مؤرشف من الأصل في 2025-06-05. اطلع عليه بتاريخ 2025-03-23.

الاستشهادات

[عدل | عدل المصدر]

وصلات خارجية

[عدل | عدل المصدر]