[ Skip to the content ]

Institute of Formal and Applied Linguistics Wiki


[ Back to the navigation ]

Differences

This shows you the differences between two versions of the page.

Link to this comparison view

Both sides previous revision Previous revision
Next revision
Previous revision
Next revision Both sides next revision
user:zeman:malt-parser [2010/05/13 13:25]
zeman liblinear.
user:zeman:malt-parser [2010/06/02 09:17]
zeman Aktualizace Co dál?
Line 125: Line 125:
 | 60000 | 1035254 | 7 dní 4:55 h | 34374 s = 9:33 h | 1 věta / 3,71 s | 85,80 % | 9.-17.4.2010 | | 60000 | 1035254 | 7 dní 4:55 h | 34374 s = 9:33 h | 1 věta / 3,71 s | 85,80 % | 9.-17.4.2010 |
 | 65000 | 1035255 | 5 dní 21:01 h | 31378 s = 8:43 h | 1 věta / 3,38 s | 85,96 % | 9.-15.4.2010 | | 65000 | 1035255 | 5 dní 21:01 h | 31378 s = 8:43 h | 1 věta / 3,38 s | 85,96 % | 9.-15.4.2010 |
-| full | 1177906, 1305554 | 10 dní 4:40 h | | | | 27.4.-7.5.2010 |+| full | 1177906, 1305554 | 10 dní 4:40 h | 46999 s = 13:03 h 1 věta / 5,07 s 86,08 % | 27.4.-14.5.2010 |
  
 ==== Trénovací data rozsekaná na pětitisícové úseky ==== ==== Trénovací data rozsekaná na pětitisícové úseky ====
Line 210: Line 210:
  
 | N | Úloha | Délka trénování | Délka parsingu | Rychlost parsingu | Úspěšnost | Datum | Poznámka | | N | Úloha | Délka trénování | Délka parsingu | Rychlost parsingu | Úspěšnost | Datum | Poznámka |
-| 1000 | 1305892 | | | | | 13.5.2010 | | +| 1000 | 1305892 | 46 s 58808 s = 16:20 h 1 věta / 6,34 s 69,82 % | 13.-14.5.2010 | | 
-| 2000 | 1305893 | | | | | 13.5.2010 | | +| 2000 | 1305893 | 1:40 min 60656 s = 16:51 h 1 věta / 6,54 s 72,01 % | 13.-14.5.2010 | | 
-| 5000 | 1306055 | | | | | 13.5.2010 | | +| 5000 | 1306055 | 6:36 min 112707 s = 31:18 h 1 věta / 12,16 s 73,71 % | 13.-14.5.2010 | | 
-| 10000 | 1306056 | | | | | 13.5.2010 | | +| 10000 | 1306056 | 10:07 min 64658 s = 17:57 h 1 věta / 6,97 s 74,49 % | 13.-14.5.2010 | | 
-| 20000 | 1306057 | | | | | 13.5.2010 | | +| 20000 | 1306057 | 25:26 min 68167 s = 18:56 h 1 věta / 7,35 s 75,00 % | 13.-14.5.2010 | | 
-| 25000 | 1306219 | | | | | 13.5.2010 | | +| 25000 | 1306219 | 40:47 min 117823 s = 32:44 h 1 věta / 12,71 s 75,11 % | 13.-14.5.2010 | | 
-| 30000 | 1306220 | | | | | 13.5.2010 | | +| 30000 | 1306220 | 34:13 min 66785 s = 18:33 h 1 věta / 7,21 s 75,41 % | 13.-14.5.2010 | | 
-| 35000 | 1306221 | | | | | 13.5.2010 | | +| 35000 | 1306221 | 37:50 min 66877 s = 18:35 h 1 věta / 7,21 s 75,66 % | 13.-14.5.2010 | | 
-| 40000 | 1306222 | | | | | 13.5.2010 | | +| 40000 | 1306222 | 46:26 min 65917 s = 18:19 h 1 věta / 7,11 s 75,88 % | 13.-14.5.2010 | | 
-| 45000 | 1306223 | | | | | 13.5.2010 | | +| 45000 | 1306223 | 1:01 h 69289 s = 19:15 h 1 věta / 7,47 s 76,11 % | 13.-14.5.2010 | | 
-| 50000 | 1306224 | | | | | 13.5.2010 | | +| 50000 | 1306224 | 55:21 min 66392 s = 18:27 h 1 věta / 7,16 s 76,28 % | 13.-14.5.2010 | | 
-| 55000 | 1306225 | | | | | 13.5.2010 | | +| 55000 | 1306225 | 1:02 h 67181 s = 18:40 h 1 věta / 7,25 s 76,40 % | 13.-14.5.2010 | | 
-| 60000 | 1306226 | | | | | 13.5.2010 | | +| 60000 | 1306226 | 1:20 h 69428 s = 19:17 h 1 věta / 7,49 s 76,59 % | 13.-14.5.2010 | | 
-| 65000 | 1306388 | | | | | 13.5.2010 | | +| 65000 | 1306388 | 1:25 h 70273 s = 19:31 h 1 věta / 7,58 s 76,58 % | 13.-14.5.2010 | | 
-| full | 1306389 | | | | | 13.5.2010 | |+| full | 1306389 | 1:07 h 66396 s = 18:27 h 1 věta / 7,16 s 76,78 % | 13.-14.5.2010 | |
  
 ==== Co dál? ==== ==== Co dál? ====
  
-  * Ještě pustit javovské ''libsvm'' a uppsalské dělení (CPOSTAG) na celý treebankZatím jsem to udělal nejvýše pro prvních 65000 větale treebank jich má přes 68000. +  * Zatím jsme se švédskou definicí rysů otestovali pouze algoritmus ''stacklazy''Vyzkoušet i ostatní (''nivrestandard'', ''nivreeager''''covproj'', ''covnonproj'', ''stackproj'', ''stackeager''), opět na různě velkých trénovacích datech.
-  * Zkusit ''liblinear'' místo ''libsvm''.+
   * Odladit ''train.pl'', aby se výsledný soubor ''.mco'' dal rozbalovat. Možná mu vadí pouze ".mco" u volby ''-c''.   * Odladit ''train.pl'', aby se výsledný soubor ''.mco'' dal rozbalovat. Možná mu vadí pouze ".mco" u volby ''-c''.
   * Jestli nakonec nějak prorazím, bude potřeba opět učesat obalovací skripty. Mj. jsem přišel na to, že ve většině svých skriptů používám jako dočasný adresář ''/tmp'' místo Milanem důrazně doporučeného ''/mnt/h/tmp''. Např. na tauri10 jsem tak počmáral 4 GB a proces skončil, protože příslušný svazek byl plný. Tohle by se mj. mělo opravit i u skriptů pro Joshuu a dalších. Jinak jsem taky mohutně čachroval s žádostí o příděl paměti na clusteru (týká se i skriptu ''qsub.csh''), s konfigurací Maltu atd.   * Jestli nakonec nějak prorazím, bude potřeba opět učesat obalovací skripty. Mj. jsem přišel na to, že ve většině svých skriptů používám jako dočasný adresář ''/tmp'' místo Milanem důrazně doporučeného ''/mnt/h/tmp''. Např. na tauri10 jsem tak počmáral 4 GB a proces skončil, protože příslušný svazek byl plný. Tohle by se mj. mělo opravit i u skriptů pro Joshuu a dalších. Jinak jsem taky mohutně čachroval s žádostí o příděl paměti na clusteru (týká se i skriptu ''qsub.csh''), s konfigurací Maltu atd.

[ Back to the navigation ] [ Back to the content ]