[ Skip to the content ]

Institute of Formal and Applied Linguistics Wiki


[ Back to the navigation ]

Differences

This shows you the differences between two versions of the page.

Link to this comparison view

Both sides previous revision Previous revision
Next revision
Previous revision
Next revision Both sides next revision
user:zeman:malt-parser [2010/04/06 14:34]
zeman Doběhly zbývající testy javových modelů.
user:zeman:malt-parser [2010/04/14 08:31]
zeman Doběhla java 45000.
Line 105: Line 105:
  
 Joakim navrhuje, abychom zkusili dělení zjemnit, např. místo CPOSTAGu dělit modely podle slovního poddruhu (druhá pozice české značky). Pak by dílčí modely byly menší a libsvm by třeba nespadlo. Ve skutečnosti budu asi muset zjemňovat jiným způsobem, protože právě u podstatných jmen žádné zvláštní dělení na poddruhy neexistuje. Mohly by ale pomoct pády. Joakim navrhuje, abychom zkusili dělení zjemnit, např. místo CPOSTAGu dělit modely podle slovního poddruhu (druhá pozice české značky). Pak by dílčí modely byly menší a libsvm by třeba nespadlo. Ve skutečnosti budu asi muset zjemňovat jiným způsobem, protože právě u podstatných jmen žádné zvláštní dělení na poddruhy neexistuje. Mohly by ale pomoct pády.
- 
- 
- 
- 
  
 ==== Javová implementace libsvm ==== ==== Javová implementace libsvm ====
  
-Předpokládá se, že vyžaduje více času a paměti. Podle dokumentace může dojít i k drobným odchylkám v úspěšnosti způsobeným odlišným zpracováním racionálních čísel. Mně se zatím zdá, že odchylky budou spíše značné, a to v neprospěch javové implementace.+Předpokládá se, že vyžaduje více času a paměti. Podle dokumentace může dojít i k drobným odchylkám v úspěšnosti způsobeným odlišným zpracováním racionálních čísel.
  
 | N | Úloha | Délka trénování | Délka parsingu | Rychlost parsingu | Úspěšnost | Poznámka | | N | Úloha | Délka trénování | Délka parsingu | Rychlost parsingu | Úspěšnost | Poznámka |
-| 1000 | 1011450 | 37 s | | | | Spadlo, kód -1 není v tabulce symbolů. | +| 1000 | 1032117 | 2:38 min | 1252 s = 20:52 min | 1 věta / 0,14 s | 74,63 % | 6.4.2010 
-| 2000 | 1011451 | 2:46 min | 661 s = 11 min | 1 věta / 0,07 s | 74,10 % | | +2000 1032118 8:44 min | 2344 s = 39:03 min | 1 věta / 0,25 s | 77,73 % | 6.4.2010 
-5000 1011452 17:45 min | 1527 s = 25 min | 1 věta / 0,16 s | 76,65 % | +5000 1040063 48:07 min 3956 s = 1:06 h | 1 věta / 0,43 s | 80,18 % | 12.4.2010 
-| 10000 | 1011453 | | | | | Nerozeběhlo se. | +10000 1032120 3:57 h | 7235 s = 2:01 h | 1 věta / 0,78 s | 82,11 % | 6.4.2010 
-20000 1011454 6:23 h 5602 s = 1:33 h | 1 věta / 0,60 s | 79,90 % | | +20000 1032121 16:45 h | 12979 s = 3:36 h | 1 věta / 1,40 s | 83,65 % | 6.-7.4.2010 
-25000 1011455 10:59 h | 6964 s = 1:56 h | 1 věta / 0,75 s | 80,32 % | +25000 1032122 27:43 h | 16500 s = 4:35 h | 1 věta / 1,78 s | 84,24 % | 6.-8.4.2010 
-| 30000 | 1011456 | | | | | Nerozeběhlo se. | +30000 1032123 47:21 h | 24255 s = 6:44 h | 1 věta / 2,62 s | 84,54 % | 6.-8.4.2010 
-35000 1011457 22:33 h | 9230 s = 2:34 h | 1 věta / 1,00 s | 81,03 % | | +35000 1035249 2 dny 11:08 h | 21468 s = 5:58 h | 1 věta / 2,32 s | 84,89 % | 9.-12.4.2010 
-40000 1011458 36:36 h | 12484 s = 3:28 h | 1 věta / 1,35 s | 81,17 % | | +40000 1035250 3 dny 10 min 24582 s = 6:50 h | 1 věta / 2,65 s | 85,08 % | 9.-12.4.2010 
-45000 1011459 46:26 h | 13889 s = 3:51 h | 1 věta / 1,50 s | 81,51 % | | +45000 1035251 4 dny 10:53 h | 33744 s = 9:22 h | 1 věta / 3,64 s | 85,35 % | 9.-14.4.2010 
-50000 1011460 58:13 h | 15711 s = 4:22 h | 1 věta / 1,69 s | 81,72 % | | +50000 1035252 | | | | | 9.4.2010 | 
-55000 1011461 65:48 h 17031 s = 4:44 h | 1 věta / 1,84 s | 81,83 % | | +55000 1035258 | | | | | 9.4.2010 
-60000 1011462 90:10 h | 18145 s = 5:02 h | 1 věta / 1,96 s | 82,11 % | | +| 60000 | 1035254 | | | | | 9.4.2010 | 
-65000 1011463 89:29 h 15808 s = 4:23 h 1 věta / 1,71 s 82,31 % | | +| 65000 | 1035255 | | | | | 9.4.2010 |
- +
  
 ==== Trénovací data rozsekaná na pětitisícové úseky ==== ==== Trénovací data rozsekaná na pětitisícové úseky ====
Line 153: Line 147:
  
 Zarážející je ale úspěšnost. Přinejmenším pro první pětitisícový úsek měla být s céčkovým libsvm 80 %, tak jaktože jsme teď vždy naměřili pod 77 %? Zarážející je ale úspěšnost. Přinejmenším pro první pětitisícový úsek měla být s céčkovým libsvm 80 %, tak jaktože jsme teď vždy naměřili pod 77 %?
 +
 +=== Oprava 6.4.2010 ===
 +
 +Předcházející pokusy s javovou implementací byly omylem spuštěny s výchozí, nikoli s Marcovou definicí rysů, což by mohlo vysvětlovat tu nižší úspěšnost. Nyní tedy druhý pokus:
 +
 +| N | Úloha | Délka trénování | Délka parsingu | Rychlost parsingu | Úspěšnost | Poznámka |
 +| 00000-04999 | 1032102 | | | | | Nevysvětlitelná náhlá smrt během trénování. |
 +| 05000-09999 | 1032103 | 24:24 min | | | 80,59 % | |
 +| 10000-14999 | 1032104 | 31:56 min | | | 80,23 % | |
 +| 15000-19999 | 1032116 | 30:27 min | | | 80,52 % | |
 +| 20000-24999 | 1032106 | 21:35 min | | | 80,45 % | |
 +| 25000-29999 | 1032107 | | | | | Nevysvětlitelná náhlá smrt během trénování. |
 +| 30000-34999 | 1032108 | 28:30 min | | | 80,48 % | |
 +| 35000-39999 | 1032109 | | | | | Nevysvětlitelná náhlá smrt během trénování. |
 +| 40000-44999 | 1032110 | 19:17 min | | | 80,51 % | |
 +| 45000-49999 | 1032111 | 22:54 min | | | 80,62 % | |
 +| 50000-54999 | 1032112 | 22:31 min | | | 80,58 % | |
 +| 55000-59999 | 1032113 | | | | | Nevysvětlitelná náhlá smrt během trénování. |
 +| 60000-64999 | 1032114 | | | | | Nevysvětlitelná náhlá smrt během trénování. |
 +| 65000-68562 | 1032115 | 12:43 min | | | 79,69 % | |
  
 ==== Co dál? ==== ==== Co dál? ====

[ Back to the navigation ] [ Back to the content ]