Differences
This shows you the differences between two versions of the page.
Both sides previous revision Previous revision Next revision | Previous revision Next revision Both sides next revision | ||
user:zeman:dz-parser:icon [2009/10/20 23:01] zeman Karma-karta. |
user:zeman:dz-parser:icon [2009/10/28 11:00] zeman Neprojektivity. |
||
---|---|---|---|
Line 15: | Line 15: | ||
* Více si pohrát s rysy. | * Více si pohrát s rysy. | ||
* Více si pohrát s konfigurací Malt parseru. | * Více si pohrát s konfigurací Malt parseru. | ||
+ | * Frekvenční slovníky, abych si trochu udělal představu o častých slovech, případně o jejich syntaktických zvláštnostech. | ||
+ | * Konverze z& | ||
+ | * Průzkum dat: jak dlouhé jsou věty? Indové v dokumentaci nějaká čísla uvádějí, ale tam se slova počítají včetně záložek a možná i včetně interpunkce, | ||
===== Průzkum dat ===== | ===== Průzkum dat ===== | ||
Line 26: | Line 29: | ||
| bengálština | 6449 | 2997 | 2336 | 14 | 398 | 367 | | | bengálština | 6449 | 2997 | 2336 | 14 | 398 | 367 | | ||
| telugština | 5494 | 2462 | 1403 | 12 | 409 | 453 | | | telugština | 5494 | 2462 | 1403 | 12 | 409 | 453 | | ||
+ | |||
+ | Takhle se z morfologických indických dat vyrobí soubor pro Tred, který obsahuje indické písmo místo WX: | ||
+ | |||
+ | < | ||
První výsledky DZ Parseru na vývojových datech: | První výsledky DZ Parseru na vývojových datech: | ||
Line 124: | Line 131: | ||
Otázka je, jestli by si lépe vedly i Malt parser a MST parser, ale to vyzkouším až později. | Otázka je, jestli by si lépe vedly i Malt parser a MST parser, ale to vyzkouším až později. | ||
Pozoruhodné je, že zhoršený DZ Parser zlepšuje výsledek hlasování, | Pozoruhodné je, že zhoršený DZ Parser zlepšuje výsledek hlasování, | ||
+ | |||
+ | Nové váhy parserů při hlasování (20.10.2009 13:26, DZ parser teď na všechno používá pád a záložku, Malt parser používá POSTAG s pádem a záložkou pro hindštinu, jinde používá CPOSTAG, MST Parser používá všude POSTAG s pádem a záložkou): | ||
+ | |||
+ | unlabeled MST:MALT:DZ | ||
+ | hi 8616: | ||
+ | bn 8570: | ||
+ | te 7985: | ||
+ | |||
+ | labels MST:MALT:DZ | ||
+ | hi 6816: | ||
+ | bn 6967: | ||
+ | te 5526: | ||
+ | |||
+ | ===== Neprojektivity ===== | ||
21:57 lrc-two:/ | 21:57 lrc-two:/ | ||
Line 152: | Line 173: | ||
Unlabeled attachment score: 947 / 1250 * 100 = 75.76 % | Unlabeled attachment score: 947 / 1250 * 100 = 75.76 % | ||
Label accuracy score: | Label accuracy score: | ||
- | |||
- | Nové váhy parserů při hlasování (20.10.2009 13:26, DZ parser teď na všechno používá pád a záložku, Malt parser používá POSTAG s pádem a záložkou pro hindštinu, jinde používá CPOSTAG, MST Parser používá všude POSTAG s pádem a záložkou): | ||
- | |||
- | unlabeled MST:MALT:DZ | ||
- | hi 8616: | ||
- | bn 8570: | ||
- | te 7985: | ||
- | |||
- | labels MST:MALT:DZ | ||
- | hi 6816: | ||
- | bn 6967: | ||
- | te 5526: | ||