[ Skip to the content ]

Institute of Formal and Applied Linguistics Wiki


[ Back to the navigation ]

Differences

This shows you the differences between two versions of the page.

Link to this comparison view

Both sides previous revision Previous revision
Next revision
Previous revision
format-conll [2009/02/26 15:50]
zeman Predicate columns.
format-conll [2009/03/01 18:54] (current)
stepanek PRED,APREDS
Line 1: Line 1:
 ====== Formát CoNLL ====== ====== Formát CoNLL ======
  
-Jednoduchý sloupcový [[Datové formáty|formát]] použitý pro uložení treebanků pro účely soutěže [[http://depparse.uvt.nl/depparse-wiki/SharedTaskWebsite|CoNLL]] v závislostním parsingu. Seznam treebanků, které máme v tomto formátu, najdete na stránce [[internal:Data#CoNLL|Data]].+Jednoduchý sloupcový [[Datové formáty|formát]] použitý pro uložení treebanků pro účely soutěže [[http://depparse.uvt.nl/depparse-wiki/SharedTaskWebsite|CoNLL]] ([[http://nextens.uvt.nl/~conll/|2006]], [[http://depparse.uvt.nl/depparse-wiki/SharedTaskWebsite|2007]], [[http://barcelona.research.yahoo.net/conll2008/|2008]], [[http://ufal.mff.cuni.cz/conll2009-st/|2009]]) v závislostním parsingu. Seznam treebanků, které máme v tomto formátu, najdete na stránce [[internal:Data#CoNLL|Data]].
  
 Každý řádek odpovídá jednomu slovu původního textu, věty jsou oddělené prázdným řádkem. Na řádku je předem známý počet hodnot (sloupců), oddělených tabulátory. To jsou hodnoty jednotlivých atributů daného slova. Podrobnější popis formátu najdete např. na http://depparse.uvt.nl/depparse-wiki/DataFormat. Každý řádek odpovídá jednomu slovu původního textu, věty jsou oddělené prázdným řádkem. Na řádku je předem známý počet hodnot (sloupců), oddělených tabulátory. To jsou hodnoty jednotlivých atributů daného slova. Podrobnější popis formátu najdete např. na http://depparse.uvt.nl/depparse-wiki/DataFormat.
 +
  
 ===== Formát CoNLL 2009 ===== ===== Formát CoNLL 2009 =====
Line 43: Line 44:
 | PRED | Rolesets of the semantic predicates in this sentence. This includes both nominal and verbal predicates. The split-form tokens that are not semantic predicates must be marked with “_”. We use the same roleset names as the PropBank and NomBank frames. | | PRED | Rolesets of the semantic predicates in this sentence. This includes both nominal and verbal predicates. The split-form tokens that are not semantic predicates must be marked with “_”. We use the same roleset names as the PropBank and NomBank frames. |
 | APREDs | Columns with argument labels for the each semantic predicate following textual order, i.e., the first column corresponds to the first predicate in PRED, the second column to the second predicate, etc. Note that, because this algorithm uniquely identifies the ID of the corresponding predicate, it is sufficient to store the label of the argument here. The argument labels for verbal predicates follow the PropBank conventions. Labels of arguments to nominal predicates use NomBank conventions. The differences between PropBank and NomBank labels are discussed here. | | APREDs | Columns with argument labels for the each semantic predicate following textual order, i.e., the first column corresponds to the first predicate in PRED, the second column to the second predicate, etc. Note that, because this algorithm uniquely identifies the ID of the corresponding predicate, it is sufficient to store the label of the argument here. The argument labels for verbal predicates follow the PropBank conventions. Labels of arguments to nominal predicates use NomBank conventions. The differences between PropBank and NomBank labels are discussed here. |
 +
 +Poznámka Dan: Z toho vysvětlení polí PRED a APREDs nejsem ani trochu moudrý a podezírám organizátory, že se tam možná upsali. Česká data obsahují v poli PRED často totéž co v poli LEMMA, ale občas je tam jakýsi identifikátor (např. "v-w3075f2"), který možná odkazuje do Vallexu. Sloupce APREDs zřejmě neodpovídají "to the first/second/etc. predicate in PRED", protože v PREDu je vždy nejvýše jeden predikát. Spíše odpovídají prvnímu/druhému/atd. argumentu predikátu v PRED. Pořadí argumentů zřejmě odpovídá povrchovému slovosledu, i když pak nechápu, jak je možné, se před vyplněnými poli mohou objevit nějaká nevyplněná (resp. vyplněná podtržítkem). Hodnotou pole jsou "labels" argumentů, v případě českých dat funktory. Zatím mi není vůbec jasné, proč se to dělá takhle složitě, proč nejsou hodnoty uložené přímo u uzlů (řádků) odpovídajících argumentům.
 +
 +Neupsali, podívej se na ten jejich příklad. Je to šíleně složité a vede to k tomu, že některé české věty mají přes sto sloupců. Námi navrhovaná reforma formátu ale neprošla. Sloupce opravdu odpovídají jednotlivým predikátům ve sloupci PRED, ale **v rámci celé věty**.
 + --- //[[stepanek@ufal.mff.cuni.cz|stepanek]] 01.3.2009 18:51//
  
 ===== Převody z a do jiných formátů ===== ===== Převody z a do jiných formátů =====

[ Back to the navigation ] [ Back to the content ]