Differences
This shows you the differences between two versions of the page.
Both sides previous revision Previous revision Next revision | Previous revision Next revision Both sides next revision | ||
user:hladka:playcoref [2009/02/24 11:29] hladka |
user:hladka:playcoref [2009/02/26 12:02] hladka |
||
---|---|---|---|
Line 1: | Line 1: | ||
- | ===== Motivace ===== | + | ====== Motivace ====== |
Na t-rovině PDT 2.0 proběhlo anotování koreference, | Na t-rovině PDT 2.0 proběhlo anotování koreference, | ||
Line 6: | Line 7: | ||
+ | ====== Motivační publikace ====== | ||
- | ===== Specifikace ===== | ||
- | |||
- | ==== Strategie hry ==== | ||
- | |||
- | ==== Texty ==== | ||
- | |||
- | === Selekce === | ||
- | |||
- | === Kodovani === | ||
- | |||
- | |||
- | |||
- | ===== Motivační publikace ===== | ||
* Návrh projektu na GAČR 2009 // | * Návrh projektu na GAČR 2009 // | ||
* [[http:// | * [[http:// | ||
Line 27: | Line 16: | ||
+ | ====== Anotování koreference v českých datech ====== | ||
+ | * PDT 2.0 [[http:// | ||
+ | * rozšířená koreference - viz přehled [[https:// | ||
+ | * [[http:// | ||
+ | * Projekt anotace rozšířené textové koreference a bridging vztahů v PDT. (Anja Nedolužko: [[http:// | ||
Line 34: | Line 28: | ||
+ | ====== Automatické určování koreference v českých datech - přehled ====== | ||
+ | * Experiments with Czech so far | ||
+ | - Nguy Giang Linh: Návrh souboru pravidel pro analýzu anafor v českém jazyce (A set of rules for anaphora resolution in Czech), MFF UK 2006. **Available: | ||
+ | - Nguy Giang Linh; Žabokrtský, | ||
+ | * Linh's procedure | ||
Line 44: | Line 43: | ||
+ | ====== Návrh hry - brainstorming ====== | ||
- | |||
- | |||
- | |||
- | |||
- | |||
- | |||
- | |||
- | |||
- | |||
- | |||
- | ===== Anotování koreference v českých datech ===== | ||
- | * PDT 2.0 [[http:// | ||
- | * rozšířená koreference - viz přehled [[https:// | ||
- | * [[http:// | ||
- | * Projekt anotace rozšířené textové koreference a bridging vztahů v PDT. (Anja Nedolužko: [[http:// | ||
- | |||
- | |||
- | ===== Automatické určování koreference v českých datech - přehled ===== | ||
- | * Dosavadní experimenty | ||
- | |||
- | |||
- | |||
- | |||
- | |||
- | |||
- | |||
- | ===== Návrh hry - brainstorming ===== | ||
**26/5/08 Anja, Bára:** | **26/5/08 Anja, Bára:** | ||
* Vstup: Texty v povrchové podobě, tedy NE tektogramatické stromy | * Vstup: Texty v povrchové podobě, tedy NE tektogramatické stromy | ||
Line 99: | Line 72: | ||
* **Vystup:** dvojice, na kterych se hraci shodli a neshodli. Shoda bude prinosna, ale co delat s temi dvojicemi, ktere oznacil pouze jeden hrac? Muze se objevit jeste jedna sance na shodu, a to ta, ktera prijde z jine partie se stejnym dokumentem. Proto bude muset byt kladen duraz na rizene podsouvani dokumentu do partii. | * **Vystup:** dvojice, na kterych se hraci shodli a neshodli. Shoda bude prinosna, ale co delat s temi dvojicemi, ktere oznacil pouze jeden hrac? Muze se objevit jeste jedna sance na shodu, a to ta, ktera prijde z jine partie se stejnym dokumentem. Proto bude muset byt kladen duraz na rizene podsouvani dokumentu do partii. | ||
* Kontrolni mechanismy, aby hraci nespojovali libovolna dve slova - vzhledem k navrhu na pocitani skore, tj. za shodu, budou hraci aspon castecne motivovani hrat smysluplne. | * Kontrolni mechanismy, aby hraci nespojovali libovolna dve slova - vzhledem k navrhu na pocitani skore, tj. za shodu, budou hraci aspon castecne motivovani hrat smysluplne. | ||
+ | |||
+ | |||
+ | |||
+ | |||
+ | ====== Specification ====== | ||
+ | |||
+ | |||
+ | |||
+ | ===== Strategy ===== | ||
+ | * **Hook up the words which refer to the same entity.** | ||
+ | * A game of two players. Players are paired randomly. Computer as a player: automatic coreference resolution **???????** | ||
+ | * Session time up to **???????** minutes. | ||
+ | * At the beginning of the game, if there is no coreference pair in the first two sentences (as determined by the manual/ | ||
+ | * What my partner is doing? If (s)he hooks up the same pair of words as I hooked up then the pair of words starts **??????? | ||
+ | * The players can re-hook up any word any time in the session. | ||
+ | * To design the game for a particular language the following data and tools are needed (or are welcome): | ||
+ | - corpus of manually anotated coreference | ||
+ | - POS tagger | ||
+ | - coreference resolution procedure | ||
+ | |||
+ | |||
+ | |||
+ | |||
+ | ===== Input Texts ===== | ||
+ | |||
+ | === Text Selection === | ||
+ | * CS data ^JM^ | ||
+ | * Anja's data ## // PDT data that are currently being annotated for the extended coreference // | ||
+ | * more ' | ||
+ | * **^JM^**: It would be nice if the players could choose a domain of the texts to play on (science-fiction, | ||
+ | * **EN** | ||
+ | * search the data that are available | ||
+ | === Coding === | ||
+ | * utf-8 | ||
+ | |||
+ | === Internal format === | ||
+ | * sgml ## //propose dtd file: include the element '' | ||
+ | |||
+ | === (Pre)processing === | ||
+ | * tagging ## //see Tools needed below// | ||
+ | * acr by Linh ## // dtto // | ||
+ | |||
+ | === Text handling === | ||
+ | * sentence by sentence | ||
+ | * supervised selection of documents for a session | ||
+ | |||
+ | |||
+ | ===== Scoring ===== | ||
+ | * '' | ||
+ | |||
+ | **^JM^**: | ||
+ | Já myslím, že do shody je tlačit chceme. Je žádoucí, aby anotace byla co nejúplnější. Když druhý hráč uvidí, že první hráč spojil nějaké slovo, vyvíjí to na něj tlak, aby se podíval, jestli to | ||
+ | nepřehlédl a jestli by ho nemohl zapojit také. Neukazuje se mu kam, takže když nenajde žádný cíl, nezapojí ho a bude se radovat, že první hráč udělal nějakou chybu. | ||
+ | |||
+ | Myslím, že ta funkce by měla brát **buď** automatickou anotaci **nebo** manuální, podle toho, co je k dispozici. Rovněž si teď myslím, že manuálně anotovaná data budeme používat minimálně - pouze pro změření úspěšnosti anotace pomocí hry - to ale nemusí být vůbec součástí skóre hry, to se udělá off-line. Manuálně anotovaných dat máme málo, jsou už anotovaná a nejsou zábavná. Z toho mi vyplývá, že bych manuální anotaci pro určování skóre nebral vůbec v úvahu a ze vzorečku nahoře bych první člen vyhodil. | ||
+ | **^BH^**: Jirka ma pravdu. Pocitani skore musi byt objektivni. Proto jsem vzorecek upravila tak, ze nebude pocitat shodu hrace vzhledem k rucni anotaci (je-li k dispozici). | ||
+ | |||
+ | |||
+ | ===== Output Data Needed ===== | ||
+ | * score list ## // | ||
+ | * documents after the '' | ||
+ | * session | ||
+ | * player_A_id, | ||
+ | * document(s) | ||
+ | * number of corrections by player_A and by player_B (JM: I do not see the point in this) | ||
+ | * corrections by player_A and by player_B (JM: and maybe nor in this) | ||
+ | |||
+ | ===== Design ===== | ||
+ | * What info to be displayed in the session? | ||
+ | * session time = elapsed time + remaining time | ||
+ | * how many sentences my partner has read so far | ||
+ | * running pts **???????** (JM: I would be very cautious with this; the user might be tempted to cancel an action if the score decreases; the user might also try to fit the automatic annotation (by trying various arrows and watching if the score goes up or down), which is not what we want) | ||
+ | * Format of the text | ||
+ | * JM: nouns and pronouns might be displayed slightly differently so that the user avoids other parts of speech easily; he should not be allowed to use other parts of speech at all | ||
+ | * Visualization of the coreference pairs | ||
+ | * colors | ||
+ | * arrows (JM: to avoid too many arrows on the screen, possibly only if the mouse pointer hovers over a word, arrows that start or end at the word would be displayed) | ||
+ | * ... | ||
+ | |||
+ | |||
+ | |||
+ | |||
+ | |||
+ | |||
+ | ===== Tools needed ===== | ||
+ | * tagger ^BH^ ## tool_chain (CAC2.0) | ||
+ | * Linh's coreference resolution procedure ^PS^ ## What type of input data the Linh's procedure works with? '' | ||
+ | * conversion: csts <-> pml m_coref scheme |