Why Are LLMs Weaker in Hungarian - Background

Miért gyengébbek a nagy nyelvi modellek magyaru

And What It Means for Your AI Project

Fekszi Csaba

Ugyanaz a modell, amely angolul a ranglisták élén áll, magyarul a pontossága felét is elvesztheti: az első magyar nyelvre épített benchmark, az OpenHuEval ténykérdés-sorozatán a GPT-4o a kérdéseknek csak a felére válaszolt helyesen.

A különbség szerkezeti és négy külön oka van, amelyeket érdemes átlátnod, mielőtt eldöntöd, mit bízol a mesterséges intelligenciára a cégedben magyar nyelven.

Ugyanaz a modell, két különböző tudásszint

2025-ben a HUN-REN Nyelvtudományi Kutatóközpont és a sanghaji Shanghai AI Laboratory közös csapata publikálta az OpenHuEval-t, az első olyan benchmarkot, amely kifejezetten a magyar nyelvre és a magyar kontextusra épül. Nyolc dimenzióban, a közmondásoktól és a történelemtől az üzleti és pénzügyi kérdésekig, összesen 3953 kérdést tartalmaz.

A benchmark egyik részfeladata, a HuSimpleQA rövid, Magyarországgal kapcsolatos ténykérdéseket tesz fel: ezeken a GPT-4o a válaszok 50,3%-át találta el, a DeepSeek-V3 32,7%-ot ért el, a Qwen2.5-72B pedig 14,9%-nál állt meg. Egy másik OpenHuEval-részfeladatban, egy magyar szövegkiegészítő teszten a legerősebb modell az esetek 17,2%-ában oldott meg hibátlanul egy teljes kérdést, mégis ugyanezek a modellek uralják az angol nyelvű ranglistákat.

A modellválasztás szempontjából még ennél is fontosabb a második megállapítás: amikor a kutatók összevetették a modellek angol nyelvű és magyar nyelvű rangsorait, a modellek 70%-a más helyen szerepelt. Ez is azt mutatja, hogy egy angolul lefuttatott szállítói összehasonlításból alig lehet következtetni arra, mi történhet majd magyar nyelven. A lemaradásnak négy oka van, és mindegyik másképp érinti a projektedet.

1. A magyar nyelv tananyag mennyisége csupán egy kerekítési hiba a tanítóanyagban

Kezdjük a nyersanyaggal. A Common Crawl legfrissebb archívumában, abban a webes korpuszban, amely a legtöbb nagy modell alatt fekszik, az oldalak 40,8%-a angol nyelvű, a magyar nyelvű oldalak pedig a webes korpusz 0,53%-át teszik ki: nagyjából minden 77 angol nyelvű oldalra jut egy magyar nyelvű.

Önmagában ezzel a nyersanyag mennyiséggel még lehetne mit kezdeni, a valódi kérdés azonban az, hogy milyen típusú magyar nyelvű szöveg kerül be a tananyagba. A magyar nyelvű webes tartalom jelentős része angol nyelvről gépi fordítással készült, sokszor másolt, duplikált vagy tartalmilag sovány, így a modell részben fordított magyar nyelvet tanul meg.

Why Are LLMs Weaker in Hungarian - Ábra 1 (HU)
Ábra 1. Az angol és a magyar nyelvű oldalak aránya a Common Crawl webes korpuszában.

2. A tokenizáló egy más típusú nyelvre készült

A modellek tokenekben olvasnak, a tokenizálókat pedig ugyanaz az angol nyelv túlsúlyú eloszlás tanítja. Az angol nyelv átlagosan 1,2 és 1,4 közötti tokent használ el szavanként, az agglutináló nyelvek viszont, ahol egyetlen szó hordozza azt, amit az angol nyelv elöljáróra, névelőre és segédigére oszt szét, ennek gyakran a kétszeresét vagy még többet.

Ebből három költség következik közvetlenül:

  • Pénz. Ugyanaz a dokumentum magyarul érezhetően több tokent fogyaszt, és egy dokumentumigényes feladatnál ez egyenesen a számlán jelenik meg.
  • Kontextus. Egy adott méretű kontextusablakba arányosan kevesebb magyar nyelvű szöveg fér be, mint angol nyelvű, egy visszakereső (RAG) rendszerben tehát kevesebb bizonyíték jut egy kérdésre.
  • Pontosság. A szétdarabolódás és a pontosság együtt mozog: egy nagy, több nyelvre kiterjedő vizsgálatban minden további szavankénti token 8 és 18 százalékpont közötti pontosságcsökkenést hozott magával, a tárgytól és a modelltől függően.

A nyelv megértése csak egy része a kihívásnak. Arról, hogyan működik a természetes nyelvfeldolgozás, részletesebben is írtunk a Mit jelent az NLP? → cikkünkben

3. A felszín alatt a modell angolul gondolkodik

Az OpenHuEval csapata szokatlan dolgot tett: felnyitotta két gondolkodó modell érvelési nyomvonalát és osztályozta, hogy mi történik bennük a magyar nyelvű feladatokon.

Találtak egy mintázatot, amelyet explicit fordításbeszúrásnak (explicit translation insertion) neveztek el. A modell a magyar nyelvű kérdés kulcsfordulatát először angolra fordítja, angolul gondolkodik végig, majd magyarul válaszol. A DeepSeek-R1 érvelési szakaszainak 5,5%-ában bukkant fel explicit fordításbeszúrás, a QwQ-nál pedig 16,8%-ban: minél gyengébb a modell magyar nyelv tudása, annál gyakrabban tesz kitérőt az angol nyelven keresztül.

A második megállapítás élesebb. Nehéz angol nyelvű matematikai feladatoknál, amikor ezek a modellek rossz végeredményt adnak, a hibás próbálkozások 72 és 78 százaléka még mindig tartalmaz legalább egy helyes közbenső gondolatot: a modell birtokában volt, aztán elvesztette a fonalat. A magyar nyelvű tényfeladatokon ez az arány 46, illetve 42 százalékra esik, vagyis a magyar nyelvű hibák többségében a helyes gondolat egyáltalán nem jelenik meg a nyomvonalban. Ez tudásbeli hiány, amelyet semennyi lépésenkénti gondolkodásra ösztönző promptolás nem tölt fel.

Egy üzleti rendszer szempontjából ez a különbségtétel döntő fontosságú. Az érvelési hibák szelíden romlanak le, és gyakran elkaphatók azzal, ha a modellt önellenőrzésre kéred; a hiányzó tudás viszont magabiztos, gördülékeny és téves választ szül egy magyar jogszabályról, egy magyar intézményről vagy egy magyar ügyfélről, és ezen az önellenőrzés nem tud segíteni, mert a modellnek nincs mihez mérnie magát.

4. A magyar nyelvet szinte senki nem méri rendesen

A magyar nyelvet értékelő készletek többsége angol adatbázisok gépi fordítása. A HuLU, a bevett magyar nyelvmegértési benchmark hét feladatot fog át, ezekből négy angolból fordított, és kizárólag feleletválasztós, illetve igaz-hamis formátumot ismer. Ez a megértést méri, arról viszont hallgat, hogy a modell képes-e használható magyar ügyféllevelet írni, követni egy magyar utasítást, vagy felismerni, ha valamit nem tud.

A gyakorlati következmény: ha egy szállító azt mondja, a modellje támogatja a magyar nyelvet, kérdezd meg, min mérték. Az őszinte válasz a legtöbb esetben az, hogy a magyar nyelv szerepelt egy fordított benchmarkban, és soha nem tesztelték olyan feladaton, amelyet egy magyar cég munkának ismerne el.

Mit változtat ez egy MI-projekten

A mesterséges intelligencia magyar nyelven is működik, azzal a feltétellel, hogy a projektet egy ismert korlát köré tervezed. Gyakorlatban ez öt dolgot jelent.

  • Mérj magyar nyelven, a saját feladataidon. Ötven valódi eset a saját működésedből, olyan kollégával pontozva, aki tudja, hogy néz ki egy jó válasz. Kétnapos munka, és többet ér minden nyilvános ranglistánál, hiszen a modellek 70%-a úgyis más helyre kerül a rangsorban, amint angolról magyarra váltasz.
  • Add meg a modellnek azt a tudást, ami hiányzik neki. A magyar vonatkozású tények, a rád vonatkozó szabályozás, a termékneveid és a saját terminológiád egy visszakereső rétegbe valók, amely lekérdezéskor táplálja a modellt. A hiány abban van, amit a modell a magyar nyelvről és rólad tud, úgyhogy, ha ezt megadod neki, a rés bezárul.
  • Tarts verziókövető terminológiai szószedetet. A magyar szakszókincs gyorsan elcsúszik az MI kimenetében, egy rövid, kontrollált saját szólista viszont, amelyet minden promptba beemelsz, stabilan tartja a regisztert.
  • Tervezd be a token-adót. Egy dokumentumigényes feladat költségszámításában az angol token-szám fölé célozz, amikor a magyar nyelvű dokumentum token-mennyiségét modellezed.
  • Tegyél embert a munkafolyamatba minden olyan pontban, ahol a válasz magyar nyelv sajátosságától függ. Jog, szabályozás, adó, közigazgatás: pontosan itt jelenik meg a magabiztos téves válasz.
Why Are LLMs Weaker in Hungarian - Ábra 2 (HU)
Ábra 2. A lemaradásnak négy szerkezeti oka van, és mind a négy mérnöki probléma, mérnöki válasszal.

A teljesítménybeli lemaradás tervezhető korlát

A magyar nyelvű teljesítménybeli lemaradás az adatmennyiségből, a tokenizálásból, a hiányzó tudásból és a felületes mérésből fakad, és mind a négy mérnöki probléma, mérnöki válasszal. Azok a cégek járnak rosszul, amelyek angol nyelven alapuló benchmark alapján választanak modellt, mégis magyar nyelvű folyamatra állítják be, és csak a munkafolyamat közben szembesülnek a különbségekkel.

A technológia önmagában ritkán garantálja egy AI-projekt sikerét. Arról, hogy milyen szerepe van a szervezetnek és az embereknek a sikeres AI-bevezetésben, részletesebben is írtunk az Az AI és Ember együtt: Hogyan alakítható át a szervezet? → cikkünkben

A technológia megértése fontos

A valódi kérdés azonban az: hol és hogyan teremthet üzleti értéket az Önök vállalatában?

Erre a válaszra strukturált felméréssel lehet eljutni. Az AI Compass Audit egy 4 hetes, fix díjas folyamat, amelynek a végén pontosan tudja: melyik pilotba érdemes belevágni, milyen siker-kritériumokkal és milyen kockázatokkal, illetve hogy a választott modell hogyan teljesít az Önök saját, magyar nyelvű feladatain. Ha egyelőre csak a kérdéseit szeretné tisztázni, egy 30 perces ingyenes konzultációval kezdhet.

Források

  • Common Crawl. (2026). CC-MAIN-2026-25 language statistics. Common Crawl. A feltérképezett weboldalak 40,8%-a angol, míg a magyar nyelvű oldalak aránya 0,53%. Cikk megnyitása →
  • Ligeti-Nagy, N., és mtsai. (2024). HuLU: Hungarian Language Understanding Benchmark Kit. LREC-COLING 2024. Bemutatja a magyar nyelvi megértést mérő benchmark felépítését és feladattípusait. Cikk megnyitása →
  • Lundin, M. (2025). The Token Tax: Systematic Bias in Multilingual Tokenization. A tokenizálás során fellépő szétdarabolódás és a feladatpontosság közötti összefüggést vizsgálja több nyelven. Cikk megnyitása →
  • Yang, X., és mtsai. (2025). OpenHuEval: Evaluating Large Language Models on Hungarian Specifics. A nagy nyelvi modellek magyar nyelvi teljesítményét vizsgálja benchmark-eredmények, rangsorváltozások, explicit fordításbeszúrás és a helyes gondolatmenetek aránya alapján. Cikk megnyitása →
Picture of Fekszi Csaba

Fekszi Csaba

Fekszi Csaba informatikai szakértő, több mint két évtizedes tapasztalattal az adat­mérnökség, a rendszerarchitektúra és az Mesterséges Intelligencia alapú folyamatoptimalizálás területén. Munkájának középpontjában olyan skálázható megoldások tervezése áll, amelyek mérhető üzleti értéket teremtenek.

Kapcsolódó cikkek

The Secret Life of LLM_How AI Actually Works - Background
AI építőkövek
Hogyan működik valójában az AI
Artificial Intelligence Explained - Background
AI az üzletben
Miért nem szabad összekeverni a ChatGPT-t az Mesterséges Intelligenciával
RAG - Retrieval-Augmented Generation - Background
AI építőkövek
Retrieval-Augmented Generation (RAG)
What the EU AI Act Means in Practice - Background
AI az üzletben
Gyakorlati útmutató pénzügyi és felső vezetőknek középvállalatoknál
Mi tartja vissza a cégét a mesterséges intelligencia bevezetésétől - Background
AI az üzletben
A vállalati mesterséges intelligencia valódi akadályai, és hogy mit csinálnak másképp a sikeres cégek

Biztos benne, hogy az AI a megfelelő következő lépés?

Segítünk feltárni a valódi lehetőségeket, korlátokat és a reális következő lépéseket.

Comments are closed.