متن (لسانيات)
في علم اللغويات، المَتْن[1][2] أو المدوَّنة[1][3] (الإنجليزية: corpus) مجموعة كبيرة من النصوص المنظمة والمهيكلة (وفي الوقت الحالي عادة ما تكون مجمعة ومعالجة إلكترونيا) تستخدم لعمل تحليل إحصائي واختبار فرضي, لفحص مقدار ظهور أو صحة القواعد اللغوية في مجال محدد. المتن قد يحتوي على نصوص من لغة واحدة ويسمى (monolingual corpus) أو نصوص بيانية من لغات متعددة ويسمى (multilingual corpus) والمتون التي تحتوي على نصوص من أكثر من لغة وتكون قد نسقت من أجل المقارنة تسمى (aligned parallel corpora.). لجعل المتون أكثر فائدة للبحوث اللغوية غالبا ما تخضع لعملية تسمى (ِAnnotation). مثال على ذلك إدخال معلومات مع كل كلمة في المتن عن نوع هذه الكلمة (اسم , فعل , حرف .... الخ) تضاف إلى المتن في شكل وسوم (Tags). مثال آخر إدخال كل كلمة مع أصلها (يذهب , ذهب). بعض المتون تكون معالجة ومحللة بشكل أعمق من ذلك فهناك عدد من المتون الصغيرة تكون قد خضعت لعملية تحليل نحوي كامل (Parsing) وعادة ما تسمى ب Treebank. وهذه العملية صعبة لذلك المتون المحللة نحويا بالكامل عادة ما تكون صغيرة تحوي على ما يقارب الواحد إلى الثلاثة مليون كلمة. وهناك أنواع عديدة لتحليل النصوص مثل التحليل المورفولوجي والدلالي.
مراجع
[عدل | عدل المصدر]- 1 2 المعجم الموحد لمصطلحات اللسانيات: (إنجليزي - فرنسي - عربي)، سلسلة المعاجم الموحدة (1) (بالعربية والإنجليزية والفرنسية) (ط. 2)، الرباط: مكتب تنسيق التعريب، 2002، ص. 38، OCLC:1049371885، QID:Q114600110
- ↑ رمزي البعلبكي (1990)، معجم المصطلحات اللغوية: انكليزي - عربي: مع 16 مسرداً عربياً (بالعربية والإنجليزية) (ط. 1)، بيروت: دار العلم للملايين، ص. 128، OCLC:30475414، QID:Q112231927
- ↑ معجم البيانات والذكاء الاصطناعي (PDF) (بالعربية والإنجليزية)، الهيئة السعودية للبيانات والذكاء الاصطناعي، 2022، QID:Q111421033