Differences
This shows you the differences between two versions of the page.
Both sides previous revision Previous revision Next revision | Previous revision Next revision Both sides next revision | ||
user:zeman:wmt [2012/01/29 22:18] zeman obo-max-test2011 |
user:zeman:wmt [2012/02/02 10:05] zeman fr-en s uvozovkami. |
||
---|---|---|---|
Line 10: | Line 10: | ||
* Udělat pořádek v záznamech. | * Udělat pořádek v záznamech. | ||
* Najít a oživit loňské pokusy s interpunkcí, | * Najít a oživit loňské pokusy s interpunkcí, | ||
+ | * Zopakovat tytéž pokusy, ale nad letos distribuovanými daty. | ||
* Převést všechny pokusy pod aktuální verzi Joshuy. | * Převést všechny pokusy pod aktuální verzi Joshuy. | ||
* Konečně převést Joshuu pod Emana. | * Konečně převést Joshuu pod Emana. | ||
Line 71: | Line 72: | ||
Podle časových značek u korpusů v '' | Podle časových značek u korpusů v '' | ||
+ | |||
+ | UPDATE: Tohle jsem k uvozovkám našel v textovém souboru s průběžnými výsledky z loňského WMT (Makefilem se tam primárně myslí Makefile dat pro WMT, tedy ''/ | ||
+ | |||
+ | |||
+ | --------------------------------------- | ||
+ | Mám k dispozici trénovací data s opravenými uvozovkami, zatím jen pro angličtinu se španělštinou. | ||
+ | Potřebuju je označkovat, | ||
+ | cd / | ||
+ | # Přidat do Makefile nově upravené korpusy mající v názvu " | ||
+ | EUROPARL = $(foreach pair, | ||
+ | NEWSCOMM = $(foreach pair, | ||
+ | # Ale pozor! Jestliže už jsme předtím zpracovali jiný jazykový pár, musíme ho z Makefile alespoň dočasně vyhodit! | ||
+ | # Jinak si novým zkopírováním zdrojových korpusů přepíšeme případnou označkovanou verzi korpusu! | ||
+ | make corpus CORPUS=europarl-v6b.fr-en LANGUAGE=fr | ||
+ | # Teď použijeme TectoMT a cluster k označkování nových korpusů. | ||
+ | cd / | ||
+ | nohup nice make CORPUS=europarl-v6b.fr-en LANGUAGE=fr >& make-euro-fren-fr.log & | ||
+ | nohup nice make CORPUS=europarl-v6b.fr-en LANGUAGE=en >& make-euro-fren-en.log & | ||
+ | nohup nice make CORPUS=news-commentary-v6b.fr-en LANGUAGE=fr >& make-news-fren-fr.log & | ||
+ | nohup nice make CORPUS=news-commentary-v6b.fr-en LANGUAGE=en >& make-news-fren-en.log & | ||
+ | # No a nyní již můžeme naklonovat nové pokusy. | ||
+ | # I když můžeme naklonovat oba směry (např. " | ||
+ | $STATMT/ | ||
+ | cd fren-stc-allemma-tmv6b-lmv6b-lm6-test2011 | ||
+ | $STATMT/ | ||
+ | vi scripts/ | ||
+ | $ac_tmtrain | ||
+ | |||
+ | Výsledky: | ||
+ | Skóre " | ||
+ | Skóre " | ||
+ | Vylaďovací ani testovací data zatím nijak upravována nebyla. | ||
+ | Jejich úpravu bychom ale měli taky otestovat, protože např. teď obsahují samé ASCII uvozovky, které jsou pro Joshuu neznámým tokenem. | ||
+ | |||
+ | es-en: dříve 0.2452, nyní 0.2428 | ||
+ | en-es: dříve 0.2590, nyní 0.2542 | ||
+ | |||
===== Inventura 16.1.2012 ===== | ===== Inventura 16.1.2012 ===== | ||
Line 103: | Line 141: | ||
| en-es | 0.2542 | 0.2542 | 0.2531 | | | en-es | 0.2542 | 0.2542 | 0.2531 | | ||
| es-en | 0.2428 | FAILED | 0.2375 | | | es-en | 0.2428 | FAILED | 0.2375 | | ||
- | | en-fr | 0.2586 | 0.2628 | | | + | | en-fr | 0.2586 | 0.2628 | 0.2619 |
- | | fr-en | 0.2294 | 0.2294 | | | + | | fr-en | 0.2294 | 0.2294 | 0.2285 |