[ Skip to the content ]

Institute of Formal and Applied Linguistics Wiki


[ Back to the navigation ]

Differences

This shows you the differences between two versions of the page.

Link to this comparison view

Both sides previous revision Previous revision
Next revision
Previous revision
Next revision Both sides next revision
user:zeman:dz-parser:conll [2008/03/28 18:57]
zeman 02 a 03.
user:zeman:dz-parser:conll [2008/04/29 12:23]
zeman Tvar parametru VAR.
Line 28: Line 28:
 $PARSER/train.pl < $DATA/$ROK/$JAZYK/dtrain.csts > $JAZYK.stat $PARSER/train.pl < $DATA/$ROK/$JAZYK/dtrain.csts > $JAZYK.stat
 ($PARSER/parse.pl -m $JAZYK.stat < $DATA/$ROK/$JAZYK/dtest.csts > $JAZYK.dtest.dz.csts) >& $JAZYK.dtest.log</code> ($PARSER/parse.pl -m $JAZYK.stat < $DATA/$ROK/$JAZYK/dtest.csts > $JAZYK.dtest.dz.csts) >& $JAZYK.dtest.log</code>
 +
 +===== Zpracování na clusteru =====
 +
 +V&nbsp;''$OUTPUT/bin'' mám několik skriptů, které odesílají parsovací úlohy na cluster:
 +  * ''qtp2006.csh'' ... přetrénování a rozbor všech jazyků 2006 bez machinací se značkami
 +  * ''qtp2007.csh'' ... přetrénování a rozbor všech jazyků 2007 bez machinací se značkami
 +  * ''qtppdt.csh'' ... přetrénování a rozbor dat se značkami převedenými do sady PDT u jazyků, u kterých to umíme, z&nbsp;obou let
 +  * ''trainparse.csh ROK JAZYK VAR INI'' ... přetrénování a rozbor jednoho korpusu (rok a jazyk jsou jasné parametry, var je varianta dat, třeba "''pdttags''", a ini je název konfiguračního souboru bez přípony .ini, třeba "''03''")
 +  * ''harvest.csh'' ... pro všechny roky a jazyky (a u korpusů, u kterých to umíme, i pro data se značkami převedenými do PDT) zavolá ''porovnat.pl'' na zlatý standard a výstup parseru, čímž kromě úspěšnosti získáme i McNemarův test statistické významnosti zlepšení nebo zhoršení, které přinesl převod značek oproti datům s&nbsp;původními značkami
 +  * ''vypsat_tabulku.pl'' dělá podobnou věc jako ''harvest.csh'', ale výsledky rovnou formátuje jako tabulku, kterou můžeme uložit v&nbsp;této wiki. Má parametr ''INI'', který říká, jaké výsledky (získané s&nbsp;jakým konfiguračním souborem) se mají sbírat.
  
 ===== Výsledky ===== ===== Výsledky =====
Line 126: Line 136:
 | zh | 2006 | 69.9 | 68.1 | horší | ne (2.330645) | | zh | 2006 | 69.9 | 68.1 | horší | ne (2.330645) |
 | zh | 2007 | 69.0 | 63.6 | horší | ano (22.769829) | | zh | 2007 | 69.0 | 63.6 | horší | ano (22.769829) |
 +
  
 ==== 02: navíc zakázané přeskakování bezdětných předložek ==== ==== 02: navíc zakázané přeskakování bezdětných předložek ====
Line 175: Line 186:
 | zh | 2007 | 69.0 | 63.5 | horší | ano (23.875776) | | zh | 2007 | 69.0 | 63.5 | horší | ano (23.875776) |
  
-==== 03: navíc zapnuté modelování pseudovale+ 
 + 
 +==== 03: navíc zapnuté modelování pseudovalence ==== 
 + 
 +Úspěšnost parsingu s&nbsp;původními značkami CoNLL:
 | Jazyk | Rok | P | | Jazyk | Rok | P |
 | ar | 2006 | 64.4 | | ar | 2006 | 64.4 |
Line 199: Line 214:
 | zh | 2007 | 64.6 | | zh | 2007 | 64.6 |
  
 +Srovnání úspěšnosti parsingu s&nbsp;původními značkami a se značkami PDT:
 | Jazyk | Rok | P(CoNLL) | P(PDT) | Změna | McNemar | | Jazyk | Rok | P(CoNLL) | P(PDT) | Změna | McNemar |
 | ar | 2006 | 64.4 | 67.6 | lepší | ano (23.953216) | | ar | 2006 | 64.4 | 67.6 | lepší | ano (23.953216) |
 | ar | 2007 | 59.8 | 67.0 | lepší | ano (165.491130) | | ar | 2007 | 59.8 | 67.0 | lepší | ano (165.491130) |
 | bg | 2006 | 67.6 | 71.0 | lepší | ano (45.224638) | | bg | 2006 | 67.6 | 71.0 | lepší | ano (45.224638) |
-| cs | 2006 | 49.62.| lepší | ano (7.529412) |+| cs | 2006 | 56.71.| lepší | ano (587.655280) |
 | cs | 2007 | 58.7 | 74.3 | lepší | ano (627.063764) | | cs | 2007 | 58.7 | 74.3 | lepší | ano (627.063764) |
 | da | 2006 | 68.3 | 69.8 | lepší | ano (8.878214) | | da | 2006 | 68.3 | 69.8 | lepší | ano (8.878214) |
 +| de | 2006 | 69.5 | 67.7 | horší | ano (9.841876) |
 | en | 2007 | 64.2 | 67.9 | lepší | ano (110.976037) | | en | 2007 | 64.2 | 67.9 | lepší | ano (110.976037) |
 +| pt | 2006 | 73.5 | 76.4 | lepší | ano (42.581187) |
 | sv | 2006 | 71.0 | 73.2 | lepší | ano (27.717540) | | sv | 2006 | 71.0 | 73.2 | lepší | ano (27.717540) |
 | zh | 2006 | 67.5 | 68.8 | lepší | ne (2.042553) | | zh | 2006 | 67.5 | 68.8 | lepší | ne (2.042553) |
 | zh | 2007 | 64.6 | 64.6 | stejná | ne (0.000000) | | zh | 2007 | 64.6 | 64.6 | stejná | ne (0.000000) |
  
 +Totéž, ale parsing s&nbsp;původními značkami použil výchozí konfiguraci místo 03.
 | Jazyk | Rok | P(CoNLL) | P(PDT) | Změna | McNemar | | Jazyk | Rok | P(CoNLL) | P(PDT) | Změna | McNemar |
 | ar | 2006 | 63.9 | 67.6 | lepší | ano (27.380000) | | ar | 2006 | 63.9 | 67.6 | lepší | ano (27.380000) |
 | ar | 2007 | 64.9 | 67.0 | lepší | ano (12.949640) | | ar | 2007 | 64.9 | 67.0 | lepší | ano (12.949640) |
 | bg | 2006 | 72.3 | 71.0 | horší | ne (3.688525) | | bg | 2006 | 72.3 | 71.0 | horší | ne (3.688525) |
-| cs | 2006 | 55.62.| lepší | ne (2.666667) |+| cs | 2006 | 64.71.| lepší | ano (167.052632) |
 | cs | 2007 | 69.1 | 74.3 | lepší | ano (87.422200) | | cs | 2007 | 69.1 | 74.3 | lepší | ano (87.422200) |
 | da | 2006 | 69.9 | 69.8 | horší | ne (0.046272) | | da | 2006 | 69.9 | 69.8 | horší | ne (0.046272) |
 +| de | 2006 | 71.8 | 67.7 | horší | ano (54.691057) |
 | en | 2007 | 70.6 | 67.9 | horší | ano (55.470000) | | en | 2007 | 70.6 | 67.9 | horší | ano (55.470000) |
 +| pt | 2006 | 73.8 | 76.4 | lepší | ano (34.848721) |
 | sv | 2006 | 71.0 | 73.2 | lepší | ano (22.530318) | | sv | 2006 | 71.0 | 73.2 | lepší | ano (22.530318) |
 | zh | 2006 | 69.9 | 68.8 | horší | ne (0.757576) | | zh | 2006 | 69.9 | 68.8 | horší | ne (0.757576) |

[ Back to the navigation ] [ Back to the content ]