[ Skip to the content ]

Institute of Formal and Applied Linguistics Wiki


[ Back to the navigation ]

Differences

This shows you the differences between two versions of the page.

Link to this comparison view

Both sides previous revision Previous revision
Next revision
Previous revision
Next revision Both sides next revision
user:zeman:moses [2008/12/15 16:58]
zeman Úprava cest v Makefilu.
user:zeman:moses [2008/12/15 17:22]
zeman Úprava.
Line 27: Line 27:
  
 Nastavuju cesty ''PWD'' a ''WS'' na začátku Makefilu. ''PWD'' vede na právě vytvořený ''moses_playground'', ''WS'' je název právě vytvořeného pracovního prostoru ''workspace.20081215-1642''. Nastavuju cesty ''PWD'' a ''WS'' na začátku Makefilu. ''PWD'' vede na právě vytvořený ''moses_playground'', ''WS'' je název právě vytvořeného pracovního prostoru ''workspace.20081215-1642''.
 +
 +
  
 ===== Příprava korpusů ===== ===== Příprava korpusů =====
Line 42: Line 44:
 mujkorpus/en.info mujkorpus/en.info
  
-Priklad viz /home/bojar/diplomka/granty/euromatrix/moses_icon08/augmented_corpora/icon-eilmt+Priklad viz /home/bojar/diplomka/granty/euromatrix/moses_icon08/augmented_corpora/icon-eilmt</code> 
 + 
 +Nějaké podsložky už tam jsou. Vytvářím novou ''enhi-dan'' a kopíruju do ní Ondrovy příklady souborů .gz a .info. Tím jsem získal kopii anglicko-hindského korpusu EILMT (7000 vět). Korpus je tokenizovaný a spárovaný po větách.
  
-Pak nechas vyrobit alignment, bud rucne, nebo napr.:+<code bash>Pak nechas vyrobit alignment, bud rucne, nebo napr.:
  
 cd augmented_corpora cd augmented_corpora
Line 56: Line 60:
 (Vystup viz napr. /a/merkur1/bojar/moses_icon08/augmented_corpora/icon-eilmt/lcstem4-lcstem4.gz) (Vystup viz napr. /a/merkur1/bojar/moses_icon08/augmented_corpora/icon-eilmt/lcstem4-lcstem4.gz)
  
-Princip je ten, ze pro kazdy korpus K maji vsechny soubory augmented_corpora/K/*.gz mit stejny pocet radek. Mohou mit ruzny pocet tokenu na radce.+Princip je ten, ze pro kazdy korpus K maji vsechny soubory augmented_corpora/K/*.gz 
 +mit stejny pocet radek. Mohou mit ruzny pocet tokenu na radce.
  
 Pak je skript augment.pl, ktery podle navodu z daneho korpusu vyreze potrebne faktory, napr.: Pak je skript augment.pl, ktery podle navodu z daneho korpusu vyreze potrebne faktory, napr.:
Line 63: Line 68:
 ./augment.pl icon-eilmt/hi+form+lcstem4 ./augment.pl icon-eilmt/hi+form+lcstem4
  
-Pozor: v soucasne dobe stale jeste nefunguji zamky v augment.pl a NFS je debilni. Muze se tedy stat, ze kdyz ma augment vyrobit nejakou novou kombinaci, ktera se sklada z take vyrabenych soucastek, tak se vyrobi neuplne gzipy!+Pozor: v soucasne dobe stale jeste nefunguji zamky v augment.pl a NFS je debilni. 
 +Muze se tedy stat, ze kdyz ma augment vyrobit nejakou novou kombinaci, 
 +ktera se sklada z take vyrabenych soucastek, tak se vyrobi neuplne gzipy!
  
-To byla priprava. :-)+To byla priprava. :-)</code>
  
 +===== Pouštění pokusů =====
  
-Samotne pokusy pak pripravuji a spoustim takto:+<code bash>Samotne pokusy pak pripravuji a spoustim takto:
  
 cd playground cd playground

[ Back to the navigation ] [ Back to the content ]