[ Skip to the content ]

Institute of Formal and Applied Linguistics Wiki


[ Back to the navigation ]

Differences

This shows you the differences between two versions of the page.

Link to this comparison view

Both sides previous revision Previous revision
Next revision
Previous revision
Next revision Both sides next revision
user:zeman:dz-parser:icon [2009/11/21 15:43]
zeman Automaticky upravovat váhy hlasování.
user:zeman:dz-parser:icon [2012/10/24 12:01]
zeman
Line 1: Line 1:
 +====== Hindi Parsing Shared Task at COLING 2012 Mumbaí ======
 +
 +Zkontrolovat normalizaci UTF-8 (dévanágarí).
 +HTB verze 0,51: train 12041 sent, 268093 tok? (words), dev 1233 / 26416
 +
 +Vyhodnotit samostatně
 +  * LAS vs. UAS
 +  * uvnitř chunku vs. mezi chunky
 +  * pro jednotlivé s-značky
 +
 +McDonald?
 +
 +Ambati et al.: MST labeler je blbej, použili maxent (http...lzhang, viz článek). A říkají tam, které featury / uzly stromu od parseru zkoumali.
 +
 +A co MST druhého řádu? Ambati et al. použili 2. řád a training-k = 5.
 +
 +MST jako vstupní featura pro Malt?
 +
 +Potřebuju nějaké vyhledávadlo a zvýrazňovadlo chyb.
 +
 +Mohly by pomoct Martinovy transformace? Normalizace hindštiny prý dělá na nových datech mnohem více chyb (uzel pod Coord nemá is_member apod.)
 +
 +Co ten neoznačkovaný text? TreeTagger?
 +
 ====== ICON 2009 NLP Tools Contest ====== ====== ICON 2009 NLP Tools Contest ======
  
Line 6: Line 30:
  
   * Upravit makefile tak, abych mohl pouštět pokusy současně se starými i novými daty. A aby se váhy hlasování automaticky upravovaly podle aktuální úspěšnosti dílčích parserů.   * Upravit makefile tak, abych mohl pouštět pokusy současně se starými i novými daty. A aby se váhy hlasování automaticky upravovaly podle aktuální úspěšnosti dílčích parserů.
 +  * Upravit makefile a/nebo skripty pro pouštění Malt parseru tak, aby Malt pro každý jazyk zvolil nejvhodnější algoritmus.
   * Více si pohrát s rysy. Naučit se parserům předhazovat rysy. U Malt parseru je to dobře zdokumentováno, u MST ne.   * Více si pohrát s rysy. Naučit se parserům předhazovat rysy. U Malt parseru je to dobře zdokumentováno, u MST ne.
   * Přidat jako rys chunk label, a to i pro DZ Parser.   * Přidat jako rys chunk label, a to i pro DZ Parser.
Line 17: Line 42:
   * Frekvenční slovníky, abych si trochu udělal představu o častých slovech, případně o jejich syntaktických zvláštnostech.   * Frekvenční slovníky, abych si trochu udělal představu o častých slovech, případně o jejich syntaktických zvláštnostech.
   * Průzkum dat: jak dlouhé jsou věty? Indové v dokumentaci nějaká čísla uvádějí, ale tam se slova počítají včetně záložek a možná i včetně interpunkce, takže neodpovídají počtu uzlů, které vidím v treebanku.   * Průzkum dat: jak dlouhé jsou věty? Indové v dokumentaci nějaká čísla uvádějí, ale tam se slova počítají včetně záložek a možná i včetně interpunkce, takže neodpovídají počtu uzlů, které vidím v treebanku.
 +  * Neučit se na hindštině a bengálštině dohromady? Jsou to přece podobné jazyky a data by se významně zvětšila!
  
 ===== Průzkum dat ===== ===== Průzkum dat =====

[ Back to the navigation ] [ Back to the content ]