Egy nagy nyelvi modell néhány magyar mondat után könnyen kelti azt a benyomást, hogy érti a nyelvünket, pedig a felszín alatt gyakran angolra optimalizált darabokból rakja össze a szavainkat. Az ELTE kutatói által fejlesztett Racka-4B azt mutatja meg, mit nyerhetünk, ha a modellt kifejezetten a magyar nyelv szerkezetéhez igazítják.
Magyarul beszélni és magyarra készülni két külön dolog
A legismertebb általános modellek soknyelvű adathalmazokon tanulnak, ezért magyarul is képesek válaszolni. Ettől még nem feltétlenül dolgozzák fel hatékonyan a ragozott alakokat, az összetett szavakat vagy a szabadabb magyar szórendet. A probléma egyik oka a tokenizálás. A modell nem egész mondatokat lát, hanem kisebb szövegegységekre, tokenekre bontja őket.
Ha egy angolra hangolt tokenizáló a megkérdezhettétek volna típusú szavakat sok apró részre szabdalja, ugyanannak a jelentésnek a feldolgozásához több token, több számítás és több idő kell. A felhasználó ebből idegen fordulatokat, bizonytalanabb ragozást vagy lassabb választ érzékelhet. A jó magyar utasítás sokat segít, ezért készítettünk külön útmutatót a magyar nyelvű promptoláshoz, de a modell nyelvi alapjait a prompt nem tudja átépíteni.
A Racka nem a nulláról indult
A Racka, teljes nevén Regionális Adatokon Célzottan Kialakított Alapmodell, az Alibaba Qwen3-4B modelljének magyarra adaptált változata. Négy milliárd paraméteres, tehát a mai csúcsmodellekhez képest kicsi. A kutatók nem egy teljes rendszert tanítottak be az elejétől, hanem a meglévő modell tudását folytatólagos előtanítással és LoRA-adapterekkel módosították. Ez jóval kevesebb számítási kapacitást igényel, mint minden paraméter újratanítása.
A Rackáról szóló kutatási tanulmány szerint a tanítás 160 milliárd tokennyi anyagon zajlott. Az adatok 44 százaléka magyar, 24 százaléka angol, 21 százaléka német, 11 százaléka pedig programkód volt. Az idegen nyelvű részek megtartása tudatos döntés, segít megőrizni az eredeti modell korábbi képességeit, miközben erősödik a magyar teljesítménye.
A legnagyobb eredmény egy kevésbé látványos alkatrész
A kutatócsoport 32 ezer, magyarra optimalizált elemmel bővítette és alakította át a Qwen szókészletét. Ennek hatására egy magyar szó feldolgozásához szükséges tokenek átlagos száma 3,13-ról 1,66-ra csökkent. Ez közel 47 százalékos javulás, vagyis ugyanaz a magyar szöveg rövidebb gépi reprezentációban fér el és gyorsabban dolgozható fel.
Ez a teljesítmény fontosabb lehet, mint egy látványos bemutatóbeszélgetés. Kevesebb token mellett csökkenhet a futtatás költsége és késleltetése, hosszabb magyar dokumentum férhet ugyanabba a kontextusablakba, a szavak szerkezete pedig kevésbé vész el a darabolás során. A Racka ezért jól illeszkedik ahhoz az irányhoz, amelyben a kisebb modellek célzott feladatokat kapnak a drága, általános rendszerek helyett.
A teszteredmények józan képet adnak
A Racka több magyar nyelvi tesztcsomagban javított az alapjául szolgáló Qwen eredményein, és egyes összesített mérésekben a kétszer nagyobb Puli modellt is megelőzte. Az előny azonban nem minden feladatban jelentkezett. Matematikai következtetésben gyengébb lett az eredeti modellnél, a magyar ténykérdésekben pedig a Puli jobb eredményt ért el. A kutatók maguk is szerény, de stabil előrelépésről írnak.
A fejlesztés másik erőssége a megvalósítás módja. A modellt a debreceni Komondor szuperszámítógépen, 64 darab A100-as grafikus processzor használatával, 287 óra alatt tanították tovább. A módszer azt bizonyítja, hogy hazai akadémiai infrastruktúrán is elvégezhető komoly nyelvi adaptáció, még ha a globális vállalatok számítási lehetőségeit nem is lehet vele lemásolni.
A Racka jelenleg kutatási alap, nem kész termék
A modell a Hugging Face felületén hozzáféréshez kötötten érhető el. A licenc kizárja az üzleti felhasználást, a modellkártya pedig egyértelműen jelzi, hogy a Racka még nem ment át a biztonságos végfelhasználói működéshez szükséges teljes utótanításon és összehangoláson. Általános chatbotként ezért nem ajánlott.
A Racka jelentősége inkább abban áll, hogy használható receptet ad magyar nyelvi modellek fejlesztéséhez: megmutatja, milyen adatarány, tokenizáló és takarékos tanítási módszer működhet elérhető hazai infrastruktúrán. A következő lépés a célzott utótanítás, a biztonsági finomhangolás és a valós magyar feladatokon végzett szélesebb tesztelés. Ettől válhat a kutatási alapmodellből olyan eszköz, amelyet vállalkozások vagy közintézmények is felelősen használhatnak.


