[ Skip to the content ]

Institute of Formal and Applied Linguistics Wiki


[ Back to the navigation ]

Differences

This shows you the differences between two versions of the page.

Link to this comparison view

Both sides previous revision Previous revision
Next revision
Previous revision
Next revision Both sides next revision
user:zeman:wmt [2013/04/15 11:40]
zeman Martinův postup zpracování velkých korpusů Treexem.
user:zeman:wmt [2013/04/16 11:24]
zeman S gigafren počkat na gigaword.en.
Line 7: Line 7:
 ===== Aktuální úkoly ===== ===== Aktuální úkoly =====
  
-  * Znova označkovat anglický Gigaword, tentokrát Featuramou+  * Dohnat pokusy s anglickým Gigawordem
-    * Označkováno už je, dva dílčí dokumenty se musely značkovat dodatečně. Nyní (pondělí 15.4.2013) běží slévání výstupu.+    * Vyrábí se jazykový model z anglického Gigawordu (od 11:14 úterý 16.4.2013)
 +    * Všechny překlady do angličtiny zopakovat s Gigawordem.
   * Pokračovat v práci na gigafren. Překladový model je natrénovaný, je potřeba vyrobit kroky model, mert, translate a evaluator.   * Pokračovat v práci na gigafren. Překladový model je natrénovaný, je potřeba vyrobit kroky model, mert, translate a evaluator.
 +    * Počkat, až bude hotový jazykový model z anglického Gigawordu, abychom nemuseli zase něco jednorázově odkládat.
 +    * Pro oba směry (en-fr a fr-en) chci překlad s Gigawordem i bez něj, tj. TM:gigafren, LM:gigafren + newsall [+ gigaword].
 +    * Pak chci ještě totéž, ale překladový model je kombinovaný s newseuro, případně i s un (ale un to asi moc nevylepší a bude to nezvladatelně veliké).
   * Dokončit pokusy s korpusy un.es-en a un.fr-en. Běží merty, pak translate a evaluator. Pak kombinace un s jinými korpusy (newseuro a newsall).   * Dokončit pokusy s korpusy un.es-en a un.fr-en. Běží merty, pak translate a evaluator. Pak kombinace un s jinými korpusy (newseuro a newsall).
 +    * Pokusy s překladovým modelem pouze na UN doběhly a moc se nevyznamenaly. Bez ohledu na to, že jazykový model obsahoval newsall i gigaword.
 +    * Ještě je ale potřeba vyzkoušet kombinovaný překladový model (newseuro+un). Ten byl na minulém hřišti úspěšný.
 +  * Obdobně mi chybí výsledky pro kombinaci Czengu a newseuro (oba směry en-cs i cs-en).
   * Zkontrolovat data pro rok 2013.   * Zkontrolovat data pro rok 2013.
     * Nejsou náhodou letos nové verze korpusů newseuro a newsall?     * Nejsou náhodou letos nové verze korpusů newseuro a newsall?
Line 21: Line 28:
     * O ruštině nemluvě...     * O ruštině nemluvě...
   * Proč při překladu odkudkoliv do angličtiny to s jazykovým modelem na newsall dopadne malinko hůř než bez něj? Nemělo by to spíš dopadnout zřetelně líp? Co je s ním? Jak je velký? Jakou dostal váhu? Jak se po jeho přidání změnil výstup překladu?   * Proč při překladu odkudkoliv do angličtiny to s jazykovým modelem na newsall dopadne malinko hůř než bez něj? Nemělo by to spíš dopadnout zřetelně líp? Co je s ním? Jak je velký? Jakou dostal váhu? Jak se po jeho přidání změnil výstup překladu?
-  * Giga.fr-en: Stále ještě se vyrábí překladový model. Pokud se ale stihne vyrobit, musím z něj vyždímat nějaké výsledky. 
   * danmake.pl na rozdíl od emana nerozlišuje kroky, které jsou OUTDATED nebo FAILED. Když mu eman select pro nějakou sadu požadavků najde několik kroků, z nichž první je nějak vadný a druhý je DONE, danmake klidně použije ten první a pak se diví.   * danmake.pl na rozdíl od emana nerozlišuje kroky, které jsou OUTDATED nebo FAILED. Když mu eman select pro nějakou sadu požadavků najde několik kroků, z nichž první je nějak vadný a druhý je DONE, danmake klidně použije ten první a pak se diví.
   * Nějak tu chybí pořádná tabulka loňských výsledků. To je mám opisovat z článku na WMT?   * Nějak tu chybí pořádná tabulka loňských výsledků. To je mám opisovat z článku na WMT?

[ Back to the navigation ] [ Back to the content ]