Differences
This shows you the differences between two versions of the page.
Both sides previous revision Previous revision Next revision | Previous revision Next revision Both sides next revision | ||
user:zeman:dz-parser:icon [2009/10/20 23:03] zeman Další to do. |
user:zeman:dz-parser:icon [2009/10/21 21:23] zeman Jak dlouhé jsou věty? |
||
---|---|---|---|
Line 17: | Line 17: | ||
* Frekvenční slovníky, abych si trochu udělal představu o častých slovech, případně o jejich syntaktických zvláštnostech. | * Frekvenční slovníky, abych si trochu udělal představu o častých slovech, případně o jejich syntaktických zvláštnostech. | ||
* Konverze z& | * Konverze z& | ||
+ | * Průzkum dat: jak dlouhé jsou věty? Indové v dokumentaci nějaká čísla uvádějí, ale tam se slova počítají včetně záložek a možná i včetně interpunkce, | ||
===== Průzkum dat ===== | ===== Průzkum dat ===== | ||
Line 28: | Line 29: | ||
| bengálština | 6449 | 2997 | 2336 | 14 | 398 | 367 | | | bengálština | 6449 | 2997 | 2336 | 14 | 398 | 367 | | ||
| telugština | 5494 | 2462 | 1403 | 12 | 409 | 453 | | | telugština | 5494 | 2462 | 1403 | 12 | 409 | 453 | | ||
+ | |||
+ | Takhle se z morfologických indických dat vyrobí soubor pro Tred, který obsahuje indické písmo místo WX: | ||
+ | |||
+ | < | ||
První výsledky DZ Parseru na vývojových datech: | První výsledky DZ Parseru na vývojových datech: |