This is an old revision of the document!
Table of Contents
TO DO
- Ze setkani 28. listopadu 2008
- Pavel: muze zacit s experimenty
- Jirka: Prevod koreference v tektogramatickych stromech anotovanych Anjou a kol. do povrchu - viz nize oddil Data Format for the Projetct Play the Language
- Bara: najit studenty k implementaci prvnich dvou her z casti 'Ideas' a zadat je k reseni. Prvni hru jiz zacal implementovat student Jan Kohout.
- Trac system - jak to s nim je?
- Pamatovat si:
- Pracovat s texty v kodovani utf-8.
Games with a purpose (GWAP)
- ontologies (semantic web)
- text (náš LGame)
Related initiatives
- Carolina Parada with Fred Jelinek
- Comments sent to Carolina: TBA
Papers to read
- (Snow et al., 2008) Cheap and Fast - But is it Good? ... , Proceedings of the Conference on Empirical Methods in Natural Language Processing, Waikiki, Honolulu, Hawaii, 2008, pp. TBA.
Ideas
Date: Fri, 10 Oct 2008 09:42:43 +0200
From: Jiří Mírovský
napadly me dve dalsi jazykove hry, ale bohuzel nejsou lingvisticky uzitecne
(nenapada mne, jak ta data vyuzit) - jen by mohly byt zabavne pro hrace a
naladit je na jine, mene zabavne lingvisticke hry.
Plus jedna, ktera by uzitecna byt mohla.
- Hraci dostanou vetu bez mezer mezi slovy a jejich ukolem je nadelat tam mezery, tedy provest tokenizaci. Jediny mozny uplatneni vidim na jazycich jako je thajstina, kde se mezery mezi slovy opravdu nepisou a na konferencich se prednasi o tom, jak to automaticky delat.
- Hraci dostanou vetu s prehazenejma slovama (kazdy jinak, nahodne). Jejich cilem je sestavit puvodni vetu. Hraji, dokud se neshodnou, vyhrava ten, kdo to mel driv. Tady uz vubec nevidim zadne vyuziti vlastnich dat, ale mohlo by to fungovat jako reklama na lingvisticke hry, protoze bych rekl, ze tohle hrace bude bavit. Aby to bylo spravedlive, algoritmus na nahodne prehazeni slov by musel byt chytry, aby to prehazel pro oba hrace ruzne, ale stejne obtizne.
- Speech reconstruction (nebo jak se tomu odborne rika) - hraci dostanou vetu z rozpoznavace reci a jejich ukolem je udelat z toho standardni ceskou vetu - bez koktani, opakovani apod.
Video
Corpora outside their original context
Data Format for the Projetct Play the Language
Date: Wed, 24 Dec 2008
From: Jiří Mírovský
Návrh formátu pro playlang (minimálně playcoref): rozšíření m-roviny z PDT 2.0
Důvody:
- automatická lemmatizace a morfologická disambiguace textů je uspokojivě zvládnutý problém, pro nás téměř zadarmo
- rozdělení textu na věty je až na morfologické rovině
- automatické procedury pro předzpracování textů (např. detekce kandidátů pro koreferenci) budou lemmatizaci a morfologii nejspíš potřebovat
- morfologická rovina jde dobře zobrazit v Tredu
Schéma rozšířené m-roviny:
/net/work/projects/playlang/playcoref/tred_extension/mdata_schema_playlang.xml
- obsahuje rozšíření o seznam struktur pro anotaci textové koreference; o strukturu jde proto, aby šly snadno přidat další atributy (podobně jako v projektu anotování rozšířené textové koreference)
Převod dat PDT 2.0 do formátu playlang:
V adresáři /net/work/projects/playlang/playcoref/data/scripts jsou skripty pro převod textové koreference z tektogramatické roviny do rozšířené m-roviny:
- _change_mschema_to_playlang.sh - změní schéma m-souborů na mdata_schema_playlang.xml
- new_textual_coreference_extract.ntred - prochází textovou koreferenci na t-rovině z projektu anotování rozšířené textové koreference a vypíše seznam textově koreferenčních dvojic - identifikátorů příslušných koreferenčních lemmat na m-rovině; koreference mezi uzly, které nemají povrchový protějšek, se nebere v úvahu
- textual_coreference_add.ntred - ze seznamu bere dvojice identifikátorů koreferenčních lemmat na m-rovině a tyto koreference vkládá do rozšířené m-roviny
Převedl jsem data z projektu anotování rozšířené koreference do rozšířené m-roviny. K dispozici jsou data train-1:
/net/work/projects/playlang/playcoref/data/files/02_bridging_playcoref/train-1
Zobrazení v Tredu:
Zbývá dodělat rozšíření Tredu pro zobrazení rozšířené morfologické roviny. Musí počkat do nového roku, neboť s tím potřebuju poradit od Petra Pajase.