[ Skip to the content ]

Institute of Formal and Applied Linguistics Wiki


[ Back to the navigation ]

Differences

This shows you the differences between two versions of the page.

Link to this comparison view

Both sides previous revision Previous revision
Next revision
Previous revision
Next revision Both sides next revision
user:rosa:gauk [2013/11/13 23:45]
rosa způsob
user:rosa:gauk [2015/01/06 14:15]
ufal +kolektiv 2015
Line 2: Line 2:
 Co je kurzívou, to je obsah velkého textového pole -- obvykle je požadavek na min. 50 znaků. Co je kurzívou, to je obsah velkého textového pole -- obvykle je požadavek na min. 50 znaků.
 Co není kurzívou, to je moje poznámka. Co není kurzívou, to je moje poznámka.
 +
 +GAUK podán 13.11.2013 {{:user:rosa:gauk_rr.pdf|}}
 +GAUK přijatý k financování 24. 03. 2014
 +Číslo účtu: 207-10/259571
  
 ===== Základní informace o projektu č. 1572314 ===== ===== Základní informace o projektu č. 1572314 =====
Line 16: Line 20:
 Sekce oborové rady: Společenské vědy - Informatika Sekce oborové rady: Společenské vědy - Informatika
 Pracoviště ÚFAL MFF UK Pracoviště ÚFAL MFF UK
-Historie stavu:  
-07. 11. 2013 - nový 
  
 ===== Řešitelský kolektiv ===== ===== Řešitelský kolektiv =====
 Mgr. Rudolf Rosa Mgr. Rudolf Rosa
-Stipendia 60+Stipendia <del>60</del> 50
  
 doc. Ing. Zdeněk Žabokrtský Ph.D. doc. Ing. Zdeněk Žabokrtský Ph.D.
-Osobní náklady (mzdy a odvody) 20+Osobní náklady (mzdy a odvody) <del>20</del> 10
  
 Bc. Jan Mašek Bc. Jan Mašek
-Stipendia 40+Stipendia <del>40</del> 30
  
  
 Dal jsem si 60, protože na dalších dvou návrhách GAUKů mam 20 a 20 a max pro mě je 100. Dal jsem si 60, protože na dalších dvou návrhách GAUKů mam 20 a 20 a max pro mě je 100.
 Max pro vedoucího je 20, pro spoluřešitele asi taky 100 (ale asi se očekává, že bude mít míň než hlavní řešitel - aspoň u všech GAUKů co jsem viděl to tak bylo). Max pro vedoucího je 20, pro spoluřešitele asi taky 100 (ale asi se očekává, že bude mít míň než hlavní řešitel - aspoň u všech GAUKů co jsem viděl to tak bylo).
 +Edit: Tak nakonec jsem dostal ještě 10 na GAUKu Ondry Duška (vše zřejmě krátili o 10), Petře GAUK nedali.
 +
 +==== Charakteristika řešitelského kolektivu - rok 2015: ====
 +//Hlavní řešitel, Mgr. Rudolf Rosa, je studentem druhého ročníku doktorského studia Matematické lingvistiky na Ústavu formální a aplikované lingvistiky MFF UK v Praze, v červnu 2013 dokončil navazující magisterské studium tamtéž. Po dobu studia se podílel a podílí na několika výzkumných projektech, zaměřených na zlepšování kvality strojového překladu, a je spoluautorem řady článků prezentovaných na mezinárodních konferencích. Téma grantového projektu je součástí jeho disertace. V projektu se bude soustředit na jeho hlavní cíl, tj. technologie přenosu nástrojů syntaktické analýzy napříč jazyky.
 +Životopis a seznam vybraných publikací řešitele se nacházejí v příloze.
 +
 +Školitel doc. Ing. Zdeněk Žabokrtský Ph. D. je docentem na Ústavu formální a aplikované lingvistiky. Dlouhodobě se zabývá parsingem, závislostní syntaxí, tektogramatickými strukturami, valencí sloves, zdroji lingvistických dat a strojovým překladem. Podílí se na projektu HamleDT, jehož cílem je konverze různých závislostních korpusů do společného formátu a jejich částečná harmonizace, a na nějž navazuje tento grantový projekt. Řešitelům poskytne metodické vedení při výzkumných pracích a přípravě prezentací výsledků.
 +Životopis a seznam vybraných publikací školitele se nacházejí v přílohách.
 +
 +Spoluřešitel Mgr. Martin Popel je studentem šestého ročníku doktorského studia Matematické lingvistiky na Ústavu formální a aplikované lingvistiky MFF UK v Praze. V rámci projektu naváže na práci předchozího spoluřešitele, Jana Maška -- bude se zabývat shromažďováním existujících syntakticky anotovaných jazykových korpusů a jejich harmonizací do jednotného anotačního schématu.//
 +
  
 ==== Charakteristika řešitelského kolektivu - rok 2014: ==== ==== Charakteristika řešitelského kolektivu - rok 2014: ====
Line 37: Line 50:
 Životopis a publikace řešitele se nacházejí v příloze. [GAUK1039756]  Životopis a publikace řešitele se nacházejí v příloze. [GAUK1039756] 
  
-Školitel doc. Ing. Zdeněk Žabokrtský Ph. D. je docentem na Ústavu formální a aplikované lingvistiky. Dlouhodobě se zabývá parsingem, závislostní syntaxí, tektogramatickými strukturami, valencí sloves, zdroji lingvistických dat a strojovým překladem. Podílel se na projektu HamleDT 1.0, jehož cílem byla konverze různých závislostních korpusů do společného formátu a jejich částečná harmonizace, a na nějž navazuje tento grantový projekt. Řešitelům poskytne metodické vedení při výzkumných pracích a přípravě prezentací výsledků.+Školitel doc. Ing. Zdeněk Žabokrtský Ph. D. je docentem na Ústavu formální a aplikované lingvistiky. Dlouhodobě se zabývá parsingem, závislostní syntaxí, tektogramatickými strukturami, valencí sloves, zdroji lingvistických dat a strojovým překladem. Podílel se na projektu HamleDT, jehož cílem byla konverze různých závislostních korpusů do společného formátu a jejich částečná harmonizace, a na nějž navazuje tento grantový projekt. Řešitelům poskytne metodické vedení při výzkumných pracích a přípravě prezentací výsledků.
 Životopis a publikace školitele se nacházejí v přílohách. [GAUK1040080] [GAUK1040081] Životopis a publikace školitele se nacházejí v přílohách. [GAUK1040080] [GAUK1040081]
  
Line 45: Line 58:
 ===== Finanční požadavky ===== ===== Finanční požadavky =====
 Položky Rok 2014 Položky Rok 2014
-Ostatní neinvestiční náklady 10+Ostatní neinvestiční náklady <del>10</del> 5
 Cestovné 90 Cestovné 90
-Doplňkové náklady (počítá se automaticky) +Doplňkové náklady (počítá se automaticky) (27
-Osobní náklady (mzdy) a stipendia (počítá se automaticky) +Osobní náklady (mzdy) a stipendia (počítá se automaticky) (90
-Celkem (počítá se automaticky)+Celkem (počítá se automaticky) (212)
  
 ==== Struktura finančních prostředků - rok 2014: ==== ==== Struktura finančních prostředků - rok 2014: ====
Line 62: Line 75:
 Částky na stipendia a mzdy jsou navrženy v souladu s požadavky Grantové agentury UK.// Částky na stipendia a mzdy jsou navrženy v souladu s požadavky Grantové agentury UK.//
  
-Neinvest náklady:+TLT 2014: 
 +The 13th International Workshop on Treebanks and Linguistic Theories (TLT13) will be held in Tübingen on 12-13 December, 2014. 
 +http://tlt13.sfs.uni-tuebingen.de/ 
 +Jízdenka: cca 5000 Kč 
 +Ubytování na 3 noci: cca 5000 Kč 
 +Registrace: cca 2000 Kč 
 + 
 +<!--Neinvest náklady:
 Mam tam harddisky (viz materiální todleto). Požádal jsem Milana o nějakej cenovej odhad, zatim ho nemam. Mam tam harddisky (viz materiální todleto). Požádal jsem Milana o nějakej cenovej odhad, zatim ho nemam.
 Kancelářský potřeby se tam prej psát nemaj. Kancelářský potřeby se tam prej psát nemaj.
 Literaturu nevim jestli nějakou chcem kupovat. Literaturu nevim jestli nějakou chcem kupovat.
-Dal bych tam případné licence na potřebné datové zdroje, pač nevim, jestli si nějaký treebanky třeba nebudem muset koupit, ale to nevim a asi spíš ne, tak bych to tam nepsal.+Dal bych tam případné licence na potřebné datové zdroje, pač nevim, jestli si nějaký treebanky třeba nebudem muset koupit, ale to nevim a asi spíš ne, tak bych to tam nepsal.-->
  
 ===== Finanční výhled na další roky ===== ===== Finanční výhled na další roky =====
Line 205: Line 225:
  
 // //
-Východiskem pro práci na tomto projektu se stane existující kolekce syntakticky anotovaných korpusů (treebanků) HamleDT (Zeman et al. 2012).  Naším cílem bude vylepšit kvalitu této kolekce pomocí opravy chyb a nepřesností v konverzích zdrojových treebankůtak aby bylo správně zachováno co nejvíce původních informací. Bude také nutné harmonizovat odlišně anotované závislostní struktury, které v rámci projektu HamleDT harmonizovány nebyly -- například složená slovesa a podřadící spojky.+Východiskem pro práci na tomto projektu se stane existující kolekce syntakticky anotovaných korpusů (treebanků) HamleDT (Zeman et al. 2012).  Naším cílem bude vylepšit kvalitu této kolekce pomocí opravy chyb a nepřesností v konverzích zdrojových treebanků takaby bylo správně zachováno co nejvíce původních informací. Bude také nutné harmonizovat odlišně anotované závislostní struktury, které v rámci projektu HamleDT harmonizovány nebyly -- například složená slovesa a podřadící spojky.
  
 Pro odhalení chyb a nepravidelností ve výstupech konverzí budeme využívat jak pravidlových metod, které umožní odhalit přímé rozpory s anotačním schématem, tak metod pravděpodobnostního modelování a strojového učení. Ty nám umožní podchytit jevy pravidly nezachytitelné, jako jsou nepravidelnosti v rozložení jednotlivých značek přiřazených hranám (na základě různých kritérií, zejména slovních druhů slov spojených danou hranou), rozložení počtů potomků jednotlivých rodičovských uzlů, a podobně. Pro odhalení chyb a nepravidelností ve výstupech konverzí budeme využívat jak pravidlových metod, které umožní odhalit přímé rozpory s anotačním schématem, tak metod pravděpodobnostního modelování a strojového učení. Ty nám umožní podchytit jevy pravidly nezachytitelné, jako jsou nepravidelnosti v rozložení jednotlivých značek přiřazených hranám (na základě různých kritérií, zejména slovních druhů slov spojených danou hranou), rozložení počtů potomků jednotlivých rodičovských uzlů, a podobně.
Line 211: Line 231:
 Je možné, že v některých případech se ukáže jako výhodnější použít jinou verzi zdrojového treebanku -- HamleDT jako zdroj obvykle používá data ze sad CoNLL (Nilsson et al. 2007), která často již prošla nějakou automatickou konverzí, během které se mohly mnohé informace ztratit. V některých případech byla použita ne zcela kvalitní závislostní konverze původně složkového treebanku, v takových případech může být vhodné implementovat konverzi přímo z původního složkového treebanku. Je možné, že v některých případech se ukáže jako výhodnější použít jinou verzi zdrojového treebanku -- HamleDT jako zdroj obvykle používá data ze sad CoNLL (Nilsson et al. 2007), která často již prošla nějakou automatickou konverzí, během které se mohly mnohé informace ztratit. V některých případech byla použita ne zcela kvalitní závislostní konverze původně složkového treebanku, v takových případech může být vhodné implementovat konverzi přímo z původního složkového treebanku.
  
-Jedním z výstupů výše uvedených úprav bude i úprava stávajícího anotačního schématutak aby umožňoval vhodným způsobem zachytit všechny informace, které jsou obsaženy v podstatné části treebanků, ale anotační schéma PDT (Böhmová et al. 2003) je zachycuje nedostatečně nebo vůbec, neboť se v českém jazyce běžně nevyskytují -- jde například o negativní částice a členy. Bude zváženo, zda místo úpravy existující sady analytických funkcí nezvolit přechod na jinou sadu značek závislostních vztahů, inspirovanou například Stanford Typed Dependencies (De Marneffe a Manning 2008).+Jedním z výstupů výše uvedených úprav bude i úprava stávajícího anotačního schématu takaby umožňoval vhodným způsobem zachytit všechny informace, které jsou obsaženy v podstatné části treebanků, ale anotační schéma PDT (Böhmová et al. 2003) je zachycuje nedostatečně nebo vůbec, neboť se v českém jazyce běžně nevyskytují -- jde například o negativní částice a členy. Bude zváženo, zda místo úpravy existující sady analytických funkcí nezvolit přechod na jinou sadu značek závislostních vztahů, inspirovanou například Stanford Typed Dependencies (De Marneffe a Manning 2008).
  
 Dalším z podúkolů projektu bude zmapování dalších existujících treebanků, které nejsou součástí sbírky HamleDT, a jejich zapojení do projektu. V kolekci dosud chybí některé velké treebanky, jako například treebanky čínštiny, francouzštiny či jeden z německých treebanků. Dále budou přidány i některé menší existující treebanky, například pro polštinu a hebrejštinu. Dalším z podúkolů projektu bude zmapování dalších existujících treebanků, které nejsou součástí sbírky HamleDT, a jejich zapojení do projektu. V kolekci dosud chybí některé velké treebanky, jako například treebanky čínštiny, francouzštiny či jeden z německých treebanků. Dále budou přidány i některé menší existující treebanky, například pro polštinu a hebrejštinu.
Line 242: Line 262:
 ==== Prezentace výsledků: ==== ==== Prezentace výsledků: ====
 //Výsledky budou průběžně prezentovány na seminářích Ústavu formální a aplikované lingvistiky a na WDS. //Výsledky budou průběžně prezentovány na seminářích Ústavu formální a aplikované lingvistiky a na WDS.
-Budeme publikovat příspěvky na mezinárodních konferencích -- pokusíme se o přijetí článku na +Budeme publikovat příspěvky na mezinárodních konferencích -- pokusíme se o přijetí článku na konferenci LREC, ACL, a/nebo TLT -- a plánujeme i publikaci v odborném časopise, například PBML.
-konferenci LREC, ACL, a/nebo TLT -- a plánujeme i publikaci v odborném časopise, například PBML.+
 Průběžné výsledky budeme popisovat také v technických zprávách. Průběžné výsledky budeme popisovat také v technických zprávách.
 Vytvořený software bude průběžně zveřejňován na webových stránkách pod svobodnou licencí. Vytvořený software bude průběžně zveřejňován na webových stránkách pod svobodnou licencí.
Line 254: Line 273:
 ZŽ publikace {{:user:rosa:zz-pub.pdf|}} ZŽ publikace {{:user:rosa:zz-pub.pdf|}}
 HM CV {{:user:rosa:cv_masek.pdf|}} HM CV {{:user:rosa:cv_masek.pdf|}}
 +
 +===== Posudky =====
 +==== Posudek 1. ====
 +Jedná se o velmi ambiciózní projekt, autoři se chtějí měřit svými výsledky se světovou špičkou v daném oboru. Především vzhledem k dosavadním výsledkům pracoviště (ÚFAL), které má v oblasti syntaktického parsingu bezpochyby světové renomé, se podle mého názoru jedná o ambici oprávněnou. Vedoucí řešitelského kolektivu, Z. Žabokrtský, má bohaté zkušenosti v oboru, o čemž svědčí jeho publikační výstupy. Lze tedy očekávat, že pod jeho vedením projekt přinese slibované výsledky. Za klad považuji i to, že se jedná o projekt, který přímo navazuje na dosavadní výzkum na ÚFAL - konkrétně se jedná o projekt HamleDT - , na němž se hlavní řešitel aktivně podílel (viz jeho CV a pubikační činnost; mimo jiné získal také ocenění UFAL best paper award 2012 – 2013). Předpokládané publikační výstupy - účast na nejvýznamnějších světových konferencích - odpovídají celkové intenci projektu. Finanční požadavky jsou přiměřené a účelné. 
 +
 +==== Posudek 2. ====
 +Projekt řeší velmi aktuální téma a klade si velmi ambiciózní cíle. Navazuje však na kvalitní existující práci, které se účastnili i odborně fundovaní členové řešitelského týmu, takže je splnitelný. Po formální stránce je návrh dobře a výstižné strukturován, výtku by si zasloužily snad jen ojedinělé překlepy. Zajímavý problém představuje harmonizace různých typů syntaktické anotace. Autoři zřejmě předpokládají, že výsledkem bude – podobně jako v citované práci Zeman et al. (2012) – anotační schéma Pražského závislostního korpusu (PDT) a nezmiňují způsob řešení případů, kdy konkrétní anotační styl obsahuje méně nebo více informace než cílové anotační schéma. Ve všech ostatních ohledech projekt splňuje a přesahuje požadavky GA UK. Lze oprávněně očekávat, že jeho výsledky budou významným přínosem po stránce praktické i teoretické, a to i v podobě publikací vynikajících i v mezinárodním srovnání.
 +
 +==== Shrnutí zpravodaje k projektu ====
 +Oponentské posudky vyznívají pro projekt velmi příznivě a označují ho jako vysoce nadprůměrný. Jako zpravodaj mohu konstatovat, že struktura projektu je v pořádku. Rovněž tak řešitelský tým i pracoviště poskytuje záruku, že bude dosaženo vytyčených cílů. Projekt doporučím k financování. Bohužel vzhledem k velikosti přidělených finančních prostředků jsem byl nucen přistoupit ke krácení finančních prostředků pro projekt. Zdůvodnění ostatních neinvestičních nákladů (nákup pevných disků) pro projekt mi přijde dost pochybné.

[ Back to the navigation ] [ Back to the content ]