Differences
This shows you the differences between two versions of the page.
Both sides previous revision Previous revision Next revision | Previous revision Next revision Both sides next revision | ||
user:zeman:morpho-challenge-2008 [2008/07/31 16:06] zeman Sjednotit označení koncovek. |
user:zeman:morpho-challenge-2008 [2008/07/31 21:16] zeman Kam se ztrácejí slova? |
||
---|---|---|---|
Line 47: | Line 47: | ||
vzorfiltr.pl -okm en.kmeny.txt -okonc en.koncovky.txt < en.nefiltr > en.vzor</ | vzorfiltr.pl -okm en.kmeny.txt -okonc en.koncovky.txt < en.nefiltr > en.vzor</ | ||
Skript '' | Skript '' | ||
+ | |||
+ | |||
Line 65: | Line 67: | ||
V úvahu přichází několik stupňů přísnosti při aplikaci vzorů na morfematickou segmentaci: | V úvahu přichází několik stupňů přísnosti při aplikaci vzorů na morfematickou segmentaci: | ||
- Slovo rozdělit pouze v případě, že toto dělení bylo viděno v trénovacích datech a proniklo filtrem mezi výsledné vzory. Jinými slovy, kmen i koncovka musí být známé a navíc musely být viděny spolu. | - Slovo rozdělit pouze v případě, že toto dělení bylo viděno v trénovacích datech a proniklo filtrem mezi výsledné vzory. Jinými slovy, kmen i koncovka musí být známé a navíc musely být viděny spolu. | ||
+ | - Kmen a koncovka nemusely být viděny přímo spolu. Stačí, když byl kmen viděn s N jinými koncovkami, které se s hledanou koncovkou společně vyskytují alespoň v jednom vzoru. | ||
+ | - Další možnost by byla snažit se zjistit, zda slovo může náležet ke vzoru, který připouští danou koncovku. I když náš systém toto slovo zařadil k jinému slovu. Např. nejpřísnější metoda nerozdělila " | ||
- Kmen i koncovka musí být známé, ale nemusely být viděny spolu. | - Kmen i koncovka musí být známé, ale nemusely být viděny spolu. | ||
- Známá je koncovka, kmen známý být nemusí. | - Známá je koncovka, kmen známý být nemusí. | ||
Line 147: | Line 151: | ||
* Vymyslet způsob, jak využít četnosti slovních tvarů, které jsme dostali s& | * Vymyslet způsob, jak využít četnosti slovních tvarů, které jsme dostali s& | ||
* Odeslat výsledky Mikkovi. | * Odeslat výsledky Mikkovi. | ||
+ | |||
+ | |||
+ | |||
Line 167: | Line 174: | ||
Vzhledem ke způsobu vyhodnocení, | Vzhledem ke způsobu vyhodnocení, | ||
+ | Jestliže slovo obsahuje pomlčku, je to téměř jistá hranice morfémů. | ||
+ | |||
+ | Jak mám poznat podmnožinu, | ||
+ | |||
+ | Třetina slov v angličtině neprojde filtrováním vzorů. Na vstupu mám 385 tisíc slov, na výstupu 122 tisíc segmentací. (Ve skutečnosti jsem jich asi odfiltroval víc, protože na výstupu navíc mohou být i taková slova, která jsem vůbec neviděl. Můžou se tam dostat při slučování vzorů s nadmnožinami.) Otázka je, jak přesně k tomu došlo. Kdybych věděl, kde se slova ztrácejí, možná by mě napadlo, jak je neztratit úplně. To bych ale musel rozvinout ladění, abych dokázal stopovat slovo během celého procesu filtrování. |