Differences

This shows you the differences between two versions of the page.

--- user:zeman:dz-parser:icon [2012/12/07 13:50]
zeman Mumbaī
+++ user:zeman:dz-parser:icon [2012/12/09 11:56]
zeman Verze MST parseru.
@@ Line 3: / Line 3: @@
 http://ltrc.iiit.ac.in/mtpil2012/
-Zkontrolovat normalizaci UTF-8 (dévanágarí).
+===== Udělat =====
+  * Natrénovat McDonaldův MST parser. Pokud možno s pořádnými rysy, neprojektivně a druhý řád. Ale na druhou stranu, aby to taky někdy doběhlo.
+    * Ambati et al. použili 2. řád a training-k:5.
+    * Zkusit mu dát značky z jiného zdroje. Teď je to POS. Nabízí se CPOS, kombinace CPOS-POS, FEAT, nějaký výběr z FEAT (vibhakti a tam) nebo složitější kombinace výše uvedeného.
+  * Natrénovat Malt parser a mezi rysy mu přidat hypotézu od MST (parser MST-Malt podle Joakimova a Ryanova článku).
+    * To znamená, že musím vybrat nejlepší parametry trénování MST, rozdělit trénovací data na 10 dílů, opakovaně natrénovat MST na devíti dílech a pustit ho na ten desátý. Pak musím rozhodnout, jakým způsobem se názor MST předloží Maltu. Musí to být rys položky na vstupu nebo na zásobníku. Asi nejjednodušší by bylo zavést rys, který pro každé slovo řekne značku jeho rodiče. V mnoha větách to bude ukazovat na více než jedno slovo, ale někde to snad pomůže. A pokud místo značky dáme slovo, mohla by být příliš řídká data. (Můžeme ale zavést dva rysy a dát tam obojí.) Index rodiče je jako rys k ničemu, protože hodnota má v každé větě jiný význam. Nejlepší by zřejmě bylo, kdybychom dokázali posuzovat dvě položky najednou (např. dvě horní položky v zásobníku) a říct, zda si MST parser myslí, že mezi nimi vede hrana. Ale to zase neumím popsat a je otázka, jestli to vůbec umí Malt parser, resp. ten jeho SVM rádce.
+  * Zkontrolovat normalizaci UTF-8 (dévanágarí).
+  * Natrénovat samostatný značkovač syntaktických značek. Ambati et al.: MST labeler je blbej, použili maxent (http...lzhang, viz článek). A říkají tam, které rysy a uzly stromu od parseru zkoumali.
+  * Potřebuju nějaké vyhledávadlo a zvýrazňovadlo chyb.
+  * Opravit normalizaci pro HamleDT. Normalizace hindštiny prý dělá na nových datech mnohem více chyb (uzel pod Coord nemá is_member apod.) Mohly by mi pomoct Martinovy transformace koordinací?
 HTB verze 0,51: train 12041 sent, 268093 tok? (words), dev 1233 / 26416
+**MST parser:** V&nbsp;TectoMT share mají verzi 0.4.3b z&nbsp;října 2009 (''$TMT_ROOT/share/installed_tools/parser/mst/0.4.3b''). Já možná mám nebo jsem měl v&nbsp;''~/nastroje/parsery'' totéž, ale soubor README se tváří, že by to měla být verze 0.5.0. Na [[http://sourceforge.net/projects/mstparser/|Sourceforge]] se tváří, že poslední aktualizace byla 23.1.2012 a verze se stále jmenuje 0.5.0. Resp. možná se tak jmenuje až tahle letošní, protože předcházející aktivita byla 6.5.2011, a to byla zveřejněna verze 0.4.3c. (A verze 0.4.3b ve skutečnosti podle Sourceforge pochází už z&nbsp;4.4.2007.)
 Vyhodnotit samostatně
@@ Line 11: / Line 24: @@
   * pro jednotlivé s-značky
-McDonald?
+===== Výsledky =====
-Ambati et al.: MST labeler je blbej, použili maxent (http...lzhang, viz článek). A říkají tam, které featury / uzly stromu od parseru zkoumali.
-A co MST druhého řádu? Ambati et al. použili 2. řád a training-k = 5.
-MST jako vstupní featura pro Malt?
-Potřebuju nějaké vyhledávadlo a zvýrazňovadlo chyb.
+mst nonproj o2 full
+  Labeled   attachment score: 15503 / 26416 * 100 = 58.69 %
+  Unlabeled attachment score: 20408 / 26416 * 100 = 77.26 %
+  Label accuracy score:       16637 / 26416 * 100 = 62.98 %
-Mohly by pomoct Martinovy transformace? Normalizace hindštiny prý dělá na nových datech mnohem více chyb (uzel pod Coord nemá is_member apod.)
+mst nonproj o2 1000
+  Labeled   attachment score: 15624 / 26416 * 100 = 59.15 %
+  Unlabeled attachment score: 20335 / 26416 * 100 = 76.98 %
+  Label accuracy score:       16741 / 26416 * 100 = 63.37 %
-Co ten neoznačkovaný text? TreeTagger?
+Parser zřejmě použil jako part of speech sloupec CoNLL POS (nikoli CPOS nebo FEAT).
 ====== ICON 2009 NLP Tools Contest ======

[ Back to the navigation ] [ Back to the content ]

Institute of Formal and Applied Linguistics Wiki

Differences