Differences
This shows you the differences between two versions of the page.
Both sides previous revision Previous revision Next revision | Previous revision Next revision Both sides next revision | ||
user:zeman:wmt [2013/04/15 09:43] zeman S Ondřejem dořešeno. Vyhrál :-) |
user:zeman:wmt [2013/04/15 12:13] zeman Aktuální úkoly. |
||
---|---|---|---|
Line 8: | Line 8: | ||
* Znova označkovat anglický Gigaword, tentokrát Featuramou. | * Znova označkovat anglický Gigaword, tentokrát Featuramou. | ||
+ | * Označkováno už je, dva dílčí dokumenty se musely značkovat dodatečně. Nyní (pondělí 15.4.2013) běží slévání výstupu. | ||
+ | * Vyrobit jazykový model z anglického Gigawordu (předtím se ještě bude sto let vyrábět faktor stc, tak bacha, zablokuje to konzoli). | ||
+ | * Všechny překlady do angličtiny zopakovat s Gigawordem. | ||
+ | * Pokračovat v práci na gigafren. Překladový model je natrénovaný, | ||
* Dokončit pokusy s korpusy un.es-en a un.fr-en. Běží merty, pak translate a evaluator. Pak kombinace un s jinými korpusy (newseuro a newsall). | * Dokončit pokusy s korpusy un.es-en a un.fr-en. Běží merty, pak translate a evaluator. Pak kombinace un s jinými korpusy (newseuro a newsall). | ||
+ | * Pokusy s překladovým modelem pouze na UN doběhly a moc se nevyznamenaly. Bez ohledu na to, že jazykový model obsahoval newsall i gigaword. | ||
+ | * Ještě je ale potřeba vyzkoušet kombinovaný překladový model (newseuro+un). Ten byl na minulém hřišti úspěšný. | ||
* Zkontrolovat data pro rok 2013. | * Zkontrolovat data pro rok 2013. | ||
* Nejsou náhodou letos nové verze korpusů newseuro a newsall? | * Nejsou náhodou letos nové verze korpusů newseuro a newsall? | ||
Line 190: | Line 196: | ||
Ještě je potřeba to testovat stejným skriptem jako Ondřej, abychom použili stejnou tokenizaci a taky abychom dostali rozptyl skóre. | Ještě je potřeba to testovat stejným skriptem jako Ondřej, abychom použili stejnou tokenizaci a taky abychom dostali rozptyl skóre. | ||
+ | ===== Jak zpracovat obří korpus Treexem, třeba označkovat Gigaword? ===== | ||
+ | |||
+ | Dosud jsem používal obyčejné treex -p, kde se přesměrovává standardní výstup do nějakého souboru. Pro velké korpusy, které se zpracovávají několik dní na půlce clusteru, tohle není ten nejvhodnější způsob. Vždy je pravděpodobné, | ||
+ | |||
+ | Martin preferuje jiný způsob. Tisíce vstupních souborů leží v nějaké adresářové struktuře, někdy i vícepatrové, | ||
+ | |||
+ | Martinův postup lze vykoukat z '' |