[ Skip to the content ]

Institute of Formal and Applied Linguistics Wiki


[ Back to the navigation ]

Differences

This shows you the differences between two versions of the page.

Link to this comparison view

Both sides previous revision Previous revision
Next revision
Previous revision
Next revision Both sides next revision
khresmoi:en-fr [2012/01/19 11:47]
hlavacova
khresmoi:en-fr [2012/01/19 14:15]
hlavacova
Line 7: Line 7:
 **en-fr.txt.zip** ... jen angl. texty o lécich - vypadá to jako příbalové letáky 1 092 568 sentences, 26,34M words, download plain text files (MOSES/GIZA++) **en-fr.txt.zip** ... jen angl. texty o lécich - vypadá to jako příbalové letáky 1 092 568 sentences, 26,34M words, download plain text files (MOSES/GIZA++)
 Adresář **fr** obsahuje francouzské texty, snad paralelní k en-fr.txt.zip (ověřím), v nějakém XML, morfologicky označkované. 1987 files, 14.9M tokens, 1.2M sentences Adresář **fr** obsahuje francouzské texty, snad paralelní k en-fr.txt.zip (ověřím), v nějakém XML, morfologicky označkované. 1987 files, 14.9M tokens, 1.2M sentences
-                 
  
 +==== Orphanet ====
 +info na Kh wiki: http://wiki.khresmoi.eu/index.php5/Data_sets/Orphanet
 +orig. stránka: http://www.orpha.net
 +Není to žádný kompaktní balík, to se bude muset prolejzat.
 +Navíc nejsou jasné podmínky, HON negotiates ... napíšu jim
 +
 +==== HON certified web sites ====
 +asi změť všeho možného.
 +Počet stránek, ale ruznorodych, takze na stahovani ne příliš šikovné
 +egrep "\.fr" HON_Certified_Web_Sites_1.1.xml | wc → 2675   
 +Asi tam jsou i různé úrovně "podstránek", např. www.grio.org/ a www.grio.org/liens.php

[ Back to the navigation ] [ Back to the content ]