[ Skip to the content ]

Institute of Formal and Applied Linguistics Wiki


[ Back to the navigation ]

Differences

This shows you the differences between two versions of the page.

Link to this comparison view

Both sides previous revision Previous revision
Next revision
Previous revision
Next revision Both sides next revision
user:zeman:dz-parser:conll [2008/04/25 11:42]
zeman Upřesnění parametrů.
user:zeman:dz-parser:conll [2008/04/29 10:12]
zeman Výsledky němčiny a portugalštiny.
Line 28: Line 28:
 $PARSER/train.pl < $DATA/$ROK/$JAZYK/dtrain.csts > $JAZYK.stat $PARSER/train.pl < $DATA/$ROK/$JAZYK/dtrain.csts > $JAZYK.stat
 ($PARSER/parse.pl -m $JAZYK.stat < $DATA/$ROK/$JAZYK/dtest.csts > $JAZYK.dtest.dz.csts) >& $JAZYK.dtest.log</code> ($PARSER/parse.pl -m $JAZYK.stat < $DATA/$ROK/$JAZYK/dtest.csts > $JAZYK.dtest.dz.csts) >& $JAZYK.dtest.log</code>
 +
  
  
Line 38: Line 39:
   * ''trainparse.csh ROK JAZYK VAR INI'' ... přetrénování a rozbor jednoho korpusu (rok a jazyk jsou jasné parametry, var je varianta dat, třeba "''.pdttags''", a ini je název konfiguračního souboru bez přípony .ini, třeba "''03''")   * ''trainparse.csh ROK JAZYK VAR INI'' ... přetrénování a rozbor jednoho korpusu (rok a jazyk jsou jasné parametry, var je varianta dat, třeba "''.pdttags''", a ini je název konfiguračního souboru bez přípony .ini, třeba "''03''")
   * ''harvest.csh'' ... pro všechny roky a jazyky (a u korpusů, u kterých to umíme, i pro data se značkami převedenými do PDT) zavolá ''porovnat.pl'' na zlatý standard a výstup parseru, čímž kromě úspěšnosti získáme i McNemarův test statistické významnosti zlepšení nebo zhoršení, které přinesl převod značek oproti datům s&nbsp;původními značkami   * ''harvest.csh'' ... pro všechny roky a jazyky (a u korpusů, u kterých to umíme, i pro data se značkami převedenými do PDT) zavolá ''porovnat.pl'' na zlatý standard a výstup parseru, čímž kromě úspěšnosti získáme i McNemarův test statistické významnosti zlepšení nebo zhoršení, které přinesl převod značek oproti datům s&nbsp;původními značkami
-  * ''vypsat_tabulku.pl'' dělá podobnou věc jako ''harvest.csh'', ale výsledky rovnou formátuje jako tabulku, kterou můžeme uložit v&nbsp;této wiki+  * ''vypsat_tabulku.pl'' dělá podobnou věc jako ''harvest.csh'', ale výsledky rovnou formátuje jako tabulku, kterou můžeme uložit v&nbsp;této wiki. Má parametr ''INI'', který říká, jaké výsledky (získané s&nbsp;jakým konfiguračním souborem) se mají sbírat.
  
 ===== Výsledky ===== ===== Výsledky =====
Line 186: Line 187:
 | zh | 2006 | 69.9 | 68.0 | horší | ne (2.623482) | | zh | 2006 | 69.9 | 68.0 | horší | ne (2.623482) |
 | zh | 2007 | 69.0 | 63.5 | horší | ano (23.875776) | | zh | 2007 | 69.0 | 63.5 | horší | ano (23.875776) |
 +
  
  
 ==== 03: navíc zapnuté modelování pseudovalence ==== ==== 03: navíc zapnuté modelování pseudovalence ====
  
 +Úspěšnost parsingu s&nbsp;původními značkami CoNLL:
 | Jazyk | Rok | P | | Jazyk | Rok | P |
 | ar | 2006 | 64.4 | | ar | 2006 | 64.4 |
Line 213: Line 216:
 | zh | 2007 | 64.6 | | zh | 2007 | 64.6 |
  
 +Srovnání úspěšnosti parsingu s&nbsp;původními značkami a se značkami PDT:
 | Jazyk | Rok | P(CoNLL) | P(PDT) | Změna | McNemar | | Jazyk | Rok | P(CoNLL) | P(PDT) | Změna | McNemar |
 | ar | 2006 | 64.4 | 67.6 | lepší | ano (23.953216) | | ar | 2006 | 64.4 | 67.6 | lepší | ano (23.953216) |
 | ar | 2007 | 59.8 | 67.0 | lepší | ano (165.491130) | | ar | 2007 | 59.8 | 67.0 | lepší | ano (165.491130) |
 | bg | 2006 | 67.6 | 71.0 | lepší | ano (45.224638) | | bg | 2006 | 67.6 | 71.0 | lepší | ano (45.224638) |
-| cs | 2006 | 49.62.| lepší | ano (7.529412) |+| cs | 2006 | 56.71.| lepší | ano (587.655280) |
 | cs | 2007 | 58.7 | 74.3 | lepší | ano (627.063764) | | cs | 2007 | 58.7 | 74.3 | lepší | ano (627.063764) |
 | da | 2006 | 68.3 | 69.8 | lepší | ano (8.878214) | | da | 2006 | 68.3 | 69.8 | lepší | ano (8.878214) |
 +| de | 2006 | 69.5 | 67.7 | horší | ano (9.841876) |
 | en | 2007 | 64.2 | 67.9 | lepší | ano (110.976037) | | en | 2007 | 64.2 | 67.9 | lepší | ano (110.976037) |
 +| pt | 2006 | 73.5 | 76.4 | lepší | ano (42.581187) |
 | sv | 2006 | 71.0 | 73.2 | lepší | ano (27.717540) | | sv | 2006 | 71.0 | 73.2 | lepší | ano (27.717540) |
 | zh | 2006 | 67.5 | 68.8 | lepší | ne (2.042553) | | zh | 2006 | 67.5 | 68.8 | lepší | ne (2.042553) |
 | zh | 2007 | 64.6 | 64.6 | stejná | ne (0.000000) | | zh | 2007 | 64.6 | 64.6 | stejná | ne (0.000000) |
  
 +Totéž, ale parsing s&nbsp;původními značkami použil výchozí konfiguraci místo 03.
 | Jazyk | Rok | P(CoNLL) | P(PDT) | Změna | McNemar | | Jazyk | Rok | P(CoNLL) | P(PDT) | Změna | McNemar |
 | ar | 2006 | 63.9 | 67.6 | lepší | ano (27.380000) | | ar | 2006 | 63.9 | 67.6 | lepší | ano (27.380000) |
 | ar | 2007 | 64.9 | 67.0 | lepší | ano (12.949640) | | ar | 2007 | 64.9 | 67.0 | lepší | ano (12.949640) |
 | bg | 2006 | 72.3 | 71.0 | horší | ne (3.688525) | | bg | 2006 | 72.3 | 71.0 | horší | ne (3.688525) |
-| cs | 2006 | 55.62.| lepší | ne (2.666667) |+| cs | 2006 | 64.71.| lepší | ano (167.052632) |
 | cs | 2007 | 69.1 | 74.3 | lepší | ano (87.422200) | | cs | 2007 | 69.1 | 74.3 | lepší | ano (87.422200) |
 | da | 2006 | 69.9 | 69.8 | horší | ne (0.046272) | | da | 2006 | 69.9 | 69.8 | horší | ne (0.046272) |
-| de | 2006 | 68.| 67.| horší | ne (2.892894) |+| de | 2006 | 71.| 67.| horší | ano (54.691057) |
 | en | 2007 | 70.6 | 67.9 | horší | ano (55.470000) | | en | 2007 | 70.6 | 67.9 | horší | ano (55.470000) |
 +| pt | 2006 | 73.8 | 76.4 | lepší | ano (34.848721) |
 | sv | 2006 | 71.0 | 73.2 | lepší | ano (22.530318) | | sv | 2006 | 71.0 | 73.2 | lepší | ano (22.530318) |
 | zh | 2006 | 69.9 | 68.8 | horší | ne (0.757576) | | zh | 2006 | 69.9 | 68.8 | horší | ne (0.757576) |

[ Back to the navigation ] [ Back to the content ]