فهرست مطالب
عنوان
صفحه
فصل ۱: آشنایی با تشخیص مرجع مشترک……………………… ………………………… ………………………… ……………………………………………………..۱
1-۱. مقدمه و بیان مسئله………………………………………………………………………………………………………. 1
1-2. بررسی ارتباطات هممرجعی………………………………………………………………………………………….. 6
1-2-1. هممرجع در مقابل پیشایند………………………………………………………………………………….. 9
1-۲-1-۱. ارتباط هممرجع………………………………………………………………………………………… ۱0
1-۲-1-2. ارتباط پیشایندی………………………………………………………………………………………… 11
1-۲-۲. تحلیل پیشایند……………………………………………………………………………………………………. 16
1-۲-۳. تحلیل مرجع مشترک………………………………………………………………………………………… 16
1-۲-۴. تقابل تحلیل مرجع مشترک و تحلیل پیشایندی…………………………………………….. ۱7
1-3.جمعبندی……………………………………………………………………………………………………………………… 20
فصل 2 : بخش اول……………………………………………………………………………………… 21
2-1-۱. پیشینه تشخیص مرجع مشترک…………………………………………………………………………… 21
2-1-۲. روشهای زبانشناسی…………………………………………………………………………………………….. 22
2-1-۲-1. فاکتورهای حذف کننده…………………………………………………………………………….. 23
2-1-۳-۲-۱. تطبیق جنس و عدد……………………………………………………………………….. 23
2-1-۳-۲-۱. تطبیق معنایی…………………………………………………………………………………. 24
2-1-۲-۲. فاکتورهای امتیاز دهنده ……………………………………………………………………………. 24
2-1-۳-۲-۱. مشابهت نحوی…………………………………………………………………………………. 24
2-1-۳-۲-۱. مشابهت معنایی……………………………………………………………………………….. 25
2-1-۳-۲-۱. بارز بودن…………………………………………………………………………………………… 25
2-1-۳. روشهای یادگیری ماشین……………………………………………………………………………………… 27
2-1-۳-۱. ویژگیها………………………………………………………………………………………………………. 28
2-1-۳-۲. مدلهای جفت اشاره………………………………………………………………………………….. 28
2-1-۳-۲-۱. رده بندی جفت عبارتهای اسمی…………………………………………………… 32
2-1-۳-۲-۱-1. درخت تصمیم………………………………………………………………………… 33
2-1-۳-۲-۲.افراز……………………………………………………………………………………………………… 35
2-1-۳-۲-۲-۱.درختِ بل………………………………………………………………………………….. 36
2-1-۳-۲-۲-۲. افراز گراف……………………………………………………………………………….. 38
2-1-۳-۳. روشهای مبتنی بر پیکره………………………………………………………………………………. 40
2-1-۳-۴. روشهای جایگزین………………………………………………………………………………………….. 44
2-1-۳-۴-۱. روش همآموزی…………………………………………………………………………………….. 44
2-1-۳-۴-۲. مدل احتمالاتی مرتبه اول……………………………………………………………………. 46
2-1-۳-۴-۳. رتبهبندی………………………………………………………………………………………………. 47
2-1-۳-۴-۴. فیلدهای تصادفی شرطی……………………………………………………………………… 49
2-1-۳-۴-۵. خوشهبندی………………………………………………………………………………………….. 51
2-1-۴. جمعبندی………………………………………………………………………………………………………………… 56
فصل 2: بخش دوم…………………………………………………………………………………….. 57
2-2-۱. پیکره نشانه گذاری شده توسط اطلاعات هممرجع…………………………………………………. 58
2-2-۲. پیکره بیژنخان……………………………………………………………………………………………………………. 59
2-2-۳. پیکره لوتوس……………………………………………………………………………………………………………….. 60
2-2-۴.شیوههای نشانهگذاری پیکره لوتوس…………………………………………………………………………… 62
2-2-۴-۱. نشانهگذاری انواع موجودیتها…………………………………………………………………………… 62
2-2-۴-۱-۱. موجودیت شخص……………………………………………………………………………………… 64
2-2-۴-۱-۲. موجودیت سازمان……………………………………………………………………………………… 64
2-2-۴-۱-۳. موجودیت مکان…………………………………………………………………………………………. 66
2-2-۴-۱-۴. موجودیت سیاسی……………………………………………………………………………………… 66
2-2-۴-۲.کلاس هر موجودیت……………………………………………………………………………………………. 68
2-2-۴-۲-۱.غیر ارجاعی……………………………………………………………………………………………….. 69
2-2-۴-۲-۲.ارجاعی………………………………………………………………………………………………………. 69
2-2-۴-۲-۲-۱.ارزیابی به شکل منفی……………………………………………………………………… 69
2-2-۴-۲-۲-۲.ارجاعی خاص………………………………………………………………………………….. 70
2-2-۴-۲-۲-۳.ارجاعی عمومی……………………………………………………………………………….. 70
2-2-۴-۲-۲-۴.ارجاعی زیر مشخص شده………………………………………………………………. 70
2-2-۴-۳.انواع اشاره/سطوح اشاره……………………………………………………………………………………… 71
2-2-۴-۳-۱.اشاره ساده………………………………………………………………………………………………….. 72
2-2-۴-۳-۱-۱.محدوده اشاره………………………………………………………………………………….. 72
2-2-۴-۳-۱-۲. هسته اشاره…………………………………………………………………………………….. 72
2-2-۴-۳-۱-۳.انواع اشاره ساده………………………………………………………………………………. 72
2-2-۴-۳-۲.ساختارهای پیچیده………………………………………………………………………………………. 74
2-2-۴-4-۲-۱.ساختارهای عطف بیان یا بدل………………………………………………………… 75
2-2-۵.جمعبندی……………………………………………………………………………………………………………………… 75
فصل 3: الگوریتمهای پیشنهادی………………………………………………………………… 76
3-۱. رده بندی دودویی……………………………………………………………………………………………………………. 76
3-1-1.جدا کنندههای خطی………………………………………………………………………………………………. 77
3-1-1-1 پرسپترون……………………………………………………………………………………………………….. 78
3-1-1-2 ماشین بردار پشتیبان…………………………………………………………………………………….. 80
3-1-1-3 درخت تصمیم………………………………………………………………………………………………… 85
3-۲.خوشهبندی………………………………………………………………………………………………………………………… 88
3-2-1 .الگوریتمهای افراز بستهای……………………………………………………………………………………. 89
3-2-1-1 .خوشهبندی سلسله مراتبی پایین به بالا……………………………………………………. 90
3-2-1-2 .آموزش الگوریتم خوشهبندی سلسله مراتبی…………………………………………….. 93
3-3.جمعبندی………………………………………………………………………………………………………………………….. 96
فصل 4: سیستم ارزیابی…………………………………………………………………………….. 97
4-۱.مقدمه…………………………………………………………………………………………………………………………………. 97
4-۲.سیستم شناسایی اشاره لوتوس……………………………………………………………………………………….. 98
4-2-1 .بانک اطلاعاتی………………………………………………………………………………………………………..
98
4-2-2.سیستم شناسایی اشاره………………………………………………………………………………………. 102
4-3.تشخیص اشارههای هم مرجع……………………………………………………………………………………….. 103
4-3-1 ویژگیها……………………………………………………………………………………………………………….. 104
4-3-2.الگوریتم یادگیری………………………………………………………………………………………………… 105
4-3-3.معیار ارزیابی………………………………………………………………………………………………………… 107
4-3-4.نتیجه ارزیابی……………………………………………………………………………………………………….. 110
4-3-4-1.نتایج بدست آمده……………………………………………………………………………………….. 110
4-3-4-.2چالشها و تحلیل خطا……………………………………………………………………………….. 112
4-4.جمعبندی……………………………………………………………………………………………………………………….. 115
فصل 5 :نتیجه گیری و پیشنهادها……………………………………………………………… 116
5-۱.نتیجهگیری……………………………………………………………………………………………………………………… 116
5-2.پیشنهادها………………………………………………………………………………………………………………………… 118
فصل .6 منابع………………………………………………………………………………………….. 121
فهرست جدولها
عنوان
صفحه
جدول 1-۱: مقایسه ویژگیهای دو ارتباط هممرجع وپیشایند…………………………… ۱1
جدول 2-۱: فاکتورهای متداول برای تشخیص مرجع مشترک…………………………………………….. 23
جدول 2-۲: برخی از ویژگیهای ارائه شده در تحلیل مرجع مشترک…………………… 30
جدول 2-۳: معرفی برخی از پژوهشهایی که از خوشهبندی استفاده کردهاند…………………… 55
جدول 2-4: مشخصات مربوط به انواع موجودیتها……………………………………………………………….. 62
جدول2-5: زیر گروههای موجودیت مشخص………………………………………………………………………….. 64
جدول2-6: زیر گروههای موجودیت سازمان……………………………………………………………………………. 65
جدول 2-7: زیر گروههای موجودیت مکان …………………………………………………………………………….. 66
جدول 2-8: زیر گروههای موجودیت سیاسی…………………………………………………………………………. 67
جدول 2-9: حالتهای خاص موجودیتهای سیاسی…………………………………………………………….. 68
جدول 2-10: انواع طبقهبندی اشاره………………………………………………………………………………………. 71
جدول 4-1: بانک اطلاعاتی سیستم کشف اشاره: جدول واژگان……………………………………….. 100
جدول 4-2: بانک اطلاعاتی سیستم کشف اشاره: جدول اشارهها……………………………………… 101
جدول 4-3: فهرست ویژگیهای به کار رفته در تشخیص مرجع مشترک………………………… 106
جدول 4-4: حالتهای ممکن نتایج یک ماشین یادگیر……………………………………………………… 108
جدول 4-5: نتایج ارزیابی الگوریتمهای پایه مورد بررسی…………………………………………………… 110
جدول 4-6: نتایج ارزیابی الگوریتم SVM با هستههای متفاوت………………………………………… 111
جدول 4-7: نتایج ارزیابی الگوریتم شبکه عصبی با مدلهای متفاوت………………………………. 112
فهرست شکلها
عنوان
صفحه
شکل1-۱. انواع روابط ممکن میان دو عبارت اسمی ……………………………………………………………. 12
شکل1-۲. میزان ارتباط میان حوزهها با انواع دانشهای زبانشناسی و واژگانی………………….. ۱6
شکل2-۱. نمونهای از نمونههای مثبت و منفی که توسط ۴.5C تولید شده است……………… 31
شکل2-۲. درختِ بل به ازای سه عبارت اسمی ……………………………………………………………………. 37
شکل2-3. شمایی از نشانهگذاری پیکره بیژنخان………………………………………………………………….. 60
شکل2-4. شمایی از نشانهگذاری اشارههای هم مرجع در پیکره لوتوس……………………………… 62
شکل3-۱. شمایی از دادههای خطی و غیر خطی جداییپذیر………………………………………………. 77
شکل3-۲. الگوریتم پرسپترون میانگیندار……………………………………………………………………………… 80
شکل3-3. نمونهای از یک درخت تصمیمگیری……………………………………………………………………… 86
شکل3-4.الگوریتم C5 ……………………………………………………………………………………………………………. 88
شکل3-5. مثالی از نمودار دندوگرام در تشخیص عبارتهای اسمی هممرجع……………………. 92
شکل3-6. الگوریتم خوشهبندی سلسله مراتبی پایین به بالا 93
شکل3-7.الگوریتم آموزش خوشهبندی حریصانه ………………………………….. 94
شکل3-8.الگوریتم بروزرسانی ……………………………………………………….. 96
شکل4-1 :شمای کلی از جداول این بانک اطلاعاتی لوتوس…………………………………………………. 99
شکل4-2 :شمای کلی سیستم شناسایی اشاره……………………………………………………………………. 102
شکل4-3 :شمایی از نمایش خروجی سیستم نمایش اشاره……………………………………………….. 102
شکل4-4: شمایی از نمایش خروجی سیستم نمایش واژگان…………………………………………….. 103
شکل4-5: شمایی از نمایش خروجی تعیین نمونههای مثبت و منفی………………………………. 107
شکل4-6: نمودار مقایسه الگوریتمهای پایه مورد بررسی……………………………………………………. 111
۱-۱.مقدمه و بیان مسئله
امروزه رایانه در تمام لایههای زندگی بشر نفوذ کرده است. بطوریکه استفاده از فناوری رایانه در حوزه زبانشناسی، بیش از پیش احساس میشود. «پردازش زبان طبیعی[1]»شاخهای از علم «هوش مصنوعی[2]» است كه به ماشینی كردن فرآیند زبان شناسی سنتی میپردازد. به این ترتیب با استفاده از رایانه میتوان «زبان گفتاری ونوشتاری» را پردازش نمود، به طوریکه رایانهها نیز قادر باشند زبان انسان را درک کرده و بتوانند از زبان طبیعی به عنوان ورودی وخروجی استفاده كند. به این ترتیب یک رایانه، درهنگام دریافت ورودی، نیاز به «درک» و درهنگام ارسال خروجی، نیاز به «تولید» زبان طبیعی دارد. ]81[
در زمینه پردازش زبان طبیعی پژوهشهایی مانند طبقهبندی متون[3]، برچسبگذاری ادات سخن[4]، تعیین و ابهامزدایی از معانی واژگان[5] و… انجام شده است که تنها بر روی یک حوزه خاص تمرکز داشتهاند و در نتیجه راه حلهایی جزئی در راستای اهداف کلی پردازش زبان طبیعی محسوب میشوند. تمامی این حوزههای جزئی باید حل شوند تا در نهایت رایانه بتواند همانند انسان واژگان و جملات را پردازش کرده و یا آنها را بسازد.
وظایف زبان طبیعی را میتوان به ریز کاربردها[6] و کلان کاربردها[7] افراز نمود. به طور کلی تا کنون تحقیقات انجام شده بیشتر بر روی پردازشهایی در سطح واژه و یا جمله (مانند برچسب گذاری ادات سخن، ابهام زدائی از مفهوم واژگان، شناسایی موجودیتهای نامدار[8] و … ) و یا در سطح کل متن (تشخیص هرزنامه[9]، رده بندی متون و…) متمرکز شده اند؛ برخی از کاربردها نیز مانند استخراج اطلاعات[10]، تشخیص مرجع مشترک[11] و ماشین ترجمه[12] در سطح بینابین قرار گرفتهاند. ]27[بدیهی است که در توسعه یک کاربرد سطح بالاتر همانند تعیین ویژگیهای معنایی متون، انواع متفاوتی از ویژگیهای سطح پایینتر (مانند ویژگیهای لغوی[13] و نحوی[14]) نیز لازم است، اما به لطف سیستمهای جدید که تا حد زیادی به روشهای آماری یادگیری ماشین بستگی دارند، دیگر در آنها، به تمامی ویژگیهای سطح پایینتر نیازی نیست. علت اینکه روشهای یادگیری ماشین توانستهاند با وجود سادگی، به موفقیت قابل توجهی دست یابند این است که اطلاعات آماری پایه، دانشی را فراهم میآورد که برای بسیاری از کاربردها کافی بوده و میتواند به کارائی قابل توجهی منجر شود. با این وجود، باید توجه داشت که روشهای آماری محدود است و هرگز نمیتوانند درک کاملی از محتوای معانی یک متن را فراهم آورند.
از طرفی دیگر، با فراهم شدن اطلاعات و قدرت محاسباتی بیشتر، سیستمهایی که واژگان و جملات درست را از غلط تشخیص میدهند، به طور گستردهای در حال توسعه هستند. به عنوان مثال، در زبان انگلیسی برچسب گذاری ادات سخن به صحتی برابر با ۹۸%، شیوههای تجزیه کردن[15] به صحتی برابر با ۹۰%، و شناسایی موجودیتهای نامدار به صحت ۹۱% رسیده اند. [78,55,38[.
بسیاری از پژوهشگران معتقدند كه استخراج اطلاعات به عنوان یکی از مهمترین کاربردهای پردازش زبان طبیعی محسوب میشود، که مجموعهای از تکنیکهای ردهبندی[16]، خوشهبندی[17] و قوانین وابستگی[18] است و خروجی استخراج اطلاعات شامل، شناسایی موجودیتها[19] ، تعیین نوع وگروه آنها، طبقه بندی ارتباط میان موجودیتها و همچنین استخراج رویدادهایی كه در آن مشاركت دارند، میباشد.[71[ در نهایت میتوان گفت كه خلاصه سازی، بازیابی اطلاعات[20]، دادهكاوی[21]، پرسش و پاسخ[22] و درك زبان[23] از جمله كاربردهای این سیستم هستند.
تمرکز اصلی این پژوهش بررسی فرآیند تشخیص مرجع مشترک به عنوان یکی از فرآیندهای مهم استخراج اطلاعات است؛ در تشخیص مرجع مشترک تمام عبارتهای اسمی که به یک موجودیت واحد در دنیای واقعی اشاره دارند، تعیین میگردند. هدف نهایی این پایاننامه شناسایی اشارههای هم مرجع شامل ضمیر و اسم اشاره در متون پارسی میباشد. برای تحقق این هدف نیاز به انجام پیش پردازشهایی بر روی متون خام میباشد تا دادههای مورد نیاز برای ورود به فرآیند تحلیل مرجع مشترک فراهم شوند. فرض ما بر این است که خروجی حاصل از فرآیند کشف اشاره[24] به عنوان یک پیش پردازش میتواند در کنار سایر پیمانههای پیش پردازشی مانند تجزیهگر، شناسایی موجودیتهای نامدار و… بر بهبود عملکرد تحلیل مرجع مشترک موثر واقع شود. [23،38،53،83]
به هر ترتیب شناسایی عبارتهای اسمی هممرجع از مهمترین زیر وظایف استخراج اطلاعات میباشند که بهبود عملکرد آن موجب بهبود عملکرد کلی سیستم استخراج اطلاعات و سایر سیستمهای مرتبط با آن خواهد شد.
واحد مورد بررسی در حوزه تشخیص مرجع مشترک، متن می باشد که پس از اجرای ماژولهایی متفاوت، متن مورد نظر به عبارت های اسمی یا به عبارت بهتر به اشاره تبدیل میشود. روشهای موجود در این حوزه، به دو دسته روشهای زبانشناسی[25] و روشهای یادگیری ماشین[26] تقسیم میشوند. [76[ در روش اول، ابتدا به ازای هر عبارت اسمی، مراجع کاندیدا تعیین میشود و سپس با به کارگیری مجموعهای از قواعد زبانشناسی، برخی از کاندیداها حذف شده و کاندیداهای باقیمانده نیز امتیازدهی میشوند و درنهایت کاندیدایی به عنوان مرجع برگزیده میشود که بیشترین امتیاز را کسب کرده باشد. مسئله اصلی در این روش این است که کسب اطلاعات زبانشناسی مورد نیاز، فرآیندی زمانبر، پرهزینه و پر خطاست. البته با پیدایش پیکرههای[27] زبانشناسی و موفقیت روشهای یادگیری ماشین در سایر حوزهها، روشهای زبانشناسی جای خود را به روشهای یادگیری ماشین دادند. در یادگیری ماشین، به محاسبات زبانشناسی پیچیده و سطح بالای روشهای زبانشناسی نیاز نیست به طوریکه با استفاده از دانش اندکی در زمینه زبانشناسی نیز میتوان به نتایج خوب و قابل توجهی دست یافت.
از سوی دیگر، امروزه اغلب پژوهشگران فرآیند تشخیص مرجع مشترک را به دو مرحله تقسیم می کنند. (۱) کشف و شناسایی اشاره؛ برای شناسایی عبارتهای اسمی که به موجودیت[28] ها در دنیای واقعی اشاره دارند، (۲) شناسائی اشارههایی که به یک مرجع واحد اشاره دارند. به این ترتیب در مرحله اول، اکثر عبارتهای اسمی تحت عنوان اشاره[29] و در قالب چهار گروه اصلی ضمایر[30]، اسامی خاص[31]، اسامی عام[32] و غیر اشارهها[33] قرار میگیرند،[8،910،16،48،53،72] سپس این فرآیند مشخص میکند که هر اشاره به کدام موجودیت در دنیای واقعی اختصاص دار[26]میتوان گفت که فرآیند کشف اشاره، توسعه یافتهی فرآیند شناسایی موجودیتهای نامدار میباشد که علاوه بر شناسایی اسامی خاص، به شناسایی اسامی عام و ضمایر نیز میپردازد. [،23،72،81،113،114]از آنجائیکه بررسی فرآیندهای شناسایی اشاره و تحلیل مرجع مشترک به طور همزمان خارج از حوزهی این پایاننامه است، ما عبارتهای اسمی را در قالب انواع اشارههای گفته شده در پیکرهای تحت عنوان لوتوس برچسبگذاری مینمائیم و نتیجهی آن را برای تحلیل مرجع مشترک به کار خواهیم برد.
چارچوب کلی این پایاننامه به این صورت میباشد: در بخش دوم این فصل گذری کوتاه بر انواع روابط میان دو عبارت اسمی و به خصوص ارتباطهای هممرجعی خواهیم داشت. سپس در بخش اول فصل دوم، روشهای ارائه شده برای تشخیص مرجع مشترک را مورد بررسی و مطالعه قرار میدهیم و در بخش دوم آن، به نحوه ایجاد پیکرهای مناسب برای کشف اشاره و تحلیل مرجع مشترک خواهیم پرداخت. در فصل سوم، به الگوریتمهای مناسب برای این پایاننامه را معرفی می نمائیم. سیستم پیشهنادی برای شناسایی اشارههای ارجاع شده در فصل چهارم معرفی خواهد شد و همچنین در این فصل الگوریتمهای یادشده را مورد ارزیابی قرار میدهیم. در نهایت در فصل پنجم نیز به نتیجه گیری و پیشنهاد كارهای آتی در ادامهی این پژوهش خواهیم پرداخت.
[1] معادل پارسی عبارت انگلیسی Natural Language processing
[2] معادل پارسی عبارت انگلیسی Artificial Intelligence
[3] معادل پارسی عبارت انگلیسی Text classification
[4] معادل پارسی عبارت انگلیسی Part of speech tagging
[5] معادل پارسی عبارت انگلیسی Word sense disambiguation
[6] معادل پارسی عبارت انگلیسی Micro-task
[7] معادل پارسی عبارت انگلیسی Macro-task
[8] معادل پارسی عبارت انگیسی Named Entity Recognizers(NER)
[9] معادل پارسی عبارت انگیسی Spam Detection
[10] معادل پارسی عبارت انگیسی Information Extraction(IE)
[11] معادل پارسی عبارت انگیسی Coreference Resolution(CR)
[12] معادل پارسی عبارت انگیسی Machin Translation(MT)
[13] معادل پارسی واژه انگیسی Lexical
[14] معادل پارسی واژه انگیسی Syntactical
[15] معادل پارسی واژه انگیسی Parsing
[16] معادل پارسی واژه انگیسی Classification