افتح القائمة الرئيسية

تغييرات

تم إضافة 1 بايت ، ‏ قبل 4 سنوات
ط
إملاء و/أو تنسيق، الأخطاء المصححة: يمكن ان ← يمكن أن باستخدام أوب
'''التنقيب في النصوص'''، وأحيانا يشار إليها بالتناوب باسم [[التنقيب في البيانات]] النصية، أي ما يعني تقريبا [[تحليلات النصوص]]، يشير إلى عملية استخلاص [[معلومات]] عالية الجودة من النص. واستخلاص المعلومات عالية الجودة يكون من خلال التقسيم للأنماط والاتجاهات من خلال وسائل مثل [[التعلم الإحصائي للانماط]]. وعادة ما يتطلب التنقيب في النصوص ال عملية هيكلة للنص المدخل (عادة تحليل، جنبا إلى جنب مع إضافة بعض المميزات اللغوية المشتقة وإزالة أخرى، ومن ثم الإدراج في [[قاعدة بيانات]])، واستخلاص الأنماط في البيانات المهيكلة، وأخيرا تقييم وتفسير للناتج. 'ذات جودة عالية' في مجال التنقيب في النصوص عادة ما يشير مزيج من [[الصلة]]، و[[الحداثة (براءة اختراع)|الحداثة]]، والاهتمام. المهام النموذجية للتنقيب في النصوص تشمل [[تصنيف النصوص]]، [[تجميع النص]]، و[[استخراج مفهوم/كيان]]، وإنتاج التصنيفات الحبيبية، و[[تحليل المشاعر]]، و[[تلخيص الوثيقة]]، ونمذجة العلاقات بين الكيانات (أي تعلم العلاقات بين [[الكيانات المسماة]]).
== مثال : فهرسة النصوص ==
يمكن انأن يتعلق التنقيب النصي ب[[فهرسة]] النصوص بالنسبة للكلمات التي تحتوي عليها وهذا هو ابسط تطبيق للتنقيب النصي. ويمكن بعد ذلك ان نسأل الفهرس عن طريق كلمات مفتاحية لمعرفة التشابه بينها وبين قائمة النصوص.
يمكن توصيف خوارزمية الفهرسة بالشكل التالي :
# فهرسة النص بالنسبة للكلمات التي يحتوي عليها.
تطبيقات التنقيب النصي كثيرة تبدأ من الفهرسة بالنسبة ل[[محركات البحث]] إلى استخراج المعرفة من النصوص غير المنظمة.
هناك بعض التقنيات مثل تحويل الكلمات إلى جذوع تمكننا من تطوير الفهرسة مع ضياع بعض المعنى بالمقابل.
 
{{بذرة}}