Martina Trnková: Analýza nestrukturovaných dat
Ana lýza nestrukturovaných dat za účelem najití zajímavého patternu Cílem práce je analýza dat z jazykového korpusu. Jako dataset je použit Santa Barbara Corpus of Spoken American English. Korpus obsahuje cca 250.000 slov ve formě přepisu nahrávek převážně rozhovorů (ale také telefonních hovorů, pracovních meetingů, vyučovacích hodin atd.). Tyto rozhovory jsou náhodně vybrané napříč různými sociálními vrstvami v celé USA. V korpusu jsou tedy zastoupeny široké vzorky respondentů různých ras, náboženství, věku, zaměstnání, vzdělání a etnicko-sociálního prostředí. Dataset byl tedy vybrán zejména pro jeho rozmanitost a široký záběr, díky jemuž ho považuji za vypovídající vzorek současné mluvené americké angličtiny, vhodný k textové analýze. Účelem práce je najití zajímavého patternu, který by mohl sloužit k efektivnímu rozšíření slovní zásoby anglického jazyka. Na základě frekvenční analýzy budou extrahována nejvíce a nejméně používaná slovesa ...