Mi az a világmodell
Hogyan tanul az AI a világ működéséről
- AI Körkép
Világmodellt mindannyian használunk nap mint nap: aki labdát kap el, előre tudja, hová esik majd. Ugyanezt most a gépek is tanulják, és ez előbb-utóbb a vállalatok működésében és döntéseiben is megjelenik.
New York-i taxiutak adatain tanítottak be egy transformer modellt, és az szinte hibátlanul adott útbaigazítást Manhattanben, kanyarról kanyarra. Az MIT, a Harvard és a Cornell kutatói ezután rekonstruálták, milyen várostérkép rajzolódott ki a modellben: képzeletbeli utcák, felüljárók és lehetetlen irányban futó utak is szerepeltek rajta. Az MIT News beszámolója szerint elég volt az utcák 1%-át lezárni, és a modell pontossága csaknem 100%-ról 67%-ra esett.
A modell ismerte az útvonalakat, de a várost mégsem értette. Éppen ezt a hiányt akarják pótolni a világmodellek, vagyis azok az AI-rendszerek, amelyek megtanulják, hogyan működik a környezetük, és mi történik benne egy-egy beavatkozás után.
A Google DeepMind, a Meta és az NVIDIA már adott ki ilyen modelleket. Két vezető kutató is céget alapított: Yann LeCun az AMI Labst, Fei-Fei Li a World Labst; a TechCrunch szerint a kettő 2026 februárjában és márciusában együtt több mint 2 milliárd dollár tőkét vont be. Az alábbiakban bemutatjuk, hogyan tanulnak a világmodellek, hol térülnek már meg a gyakorlatban, és mit érdemes a cégében már most előkészíteni.
A világmodell a következő állapotot jósolja, nem a következő szót
Világmodellt mindenki használ nap mint nap. A Meta AI-kutatói ezt a belső modellt egy szimulátorhoz hasonlítják: az ember fejben kipróbál egy mozdulatot, és azt választja, amelyikkel a legnagyobb eséllyel ér célt.
Az AI-világmodell ugyanezt végzi el, csak szoftverben. A Google DeepMind meghatározása szerint a világ egyes részeit szimulálja, hogy egy ágens előre lássa, hogyan alakul a környezete és mit változtatnak rajta a saját lépései.
A világmodellt a nagy nyelvi modelltől az különbözteti meg, hogy mit jósol. A nyelvi modell a következő szót jósolja meg, a világmodell pedig a következő állapotot: milyen lesz a jelenet, a gép vagy az út, sokszor egy adott beavatkozás nyomán.
Ha azt is szeretné megérteni, mi történik ennek az összehasonlításnak a nyelvi modell oldalán, erről részletesebben itt írunk: A nagy nyelvi modellek titkos élete: hogyan működik valójában az AI →
A jó előrejelzés és a világ megértése két külön dolog
Az, hogy egy modell jól jósol, még nem jelenti azt, hogy érti is a világot; a kettőt külön kell mérni. Keyon Vafa és munkatársai ezt a térképeknél bizonyították be; taxis kísérletüket a NeurIPS 2024 konferencián mutatták be. Ugyanez a csoport egy újabb tanulmányban, az ICML 2025 konferencián, a fizikában is ugyanerre jutott.
Bolygópályákon tanítottak be egy modellt, és az pontosan jelezte előre a pályákat, még olyan naprendszerekben is, amelyek nem szerepeltek a tanítóadataiban. Amikor azonban azt kérdezték tőle, milyen erő mozgatja a bolygókat, értelmetlen gravitációs törvénnyel állt elő, ráadásul más és más törvénnyel attól függően, hogy az adatok melyik szeletéből indultak ki.
A szerzők történelmi párhuzamot vonnak. Kepler meg tudta jósolni, hol lesznek a bolygók; Newton pedig megmagyarázta, hogy miért, és az ő törvényei egészen más feladatoknál is beváltak. A modellek Kepler szintjéig jutottak, és ott megálltak.
Hasonló a helyzet a videómodelleknél is. Az IntPhys 2 tesztet a Meta a V-JEPA 2-vel együtt adta ki; ebben a rendszernek két videó közül kell kiválasztania, melyik sérti a fizika törvényeit. Az emberek szinte hibátlanok, a mai videómodellek viszont nagyjából a véletlen találgatás szintjén teljesítenek.
A rendszer átmehet minden olyan teszten, amelyet átlagos napok adataiból állítottak össze, és az első szokatlan napon mégis elbukhat.
Három úton tanulhatják meg a gépek a világ működését
A kutatólaborok három fő úton próbálják megtanítani a gépeknek, hogyan működik a világ: a gép vagy elképzeli, vagy megfigyeli, vagy maga állítja elő a környezetét.
Első út: a gép a saját képzeletében gyakorol
Az ágens modellt épít a környezetéről, majd abban gyakorol. Az ötlet 2018-ból való: David Ha és Jürgen Schmidhuber tanulmányában az ágens végig egy álomban tanult, az álmot pedig a saját világmodellje állította elő.
A Nature folyóiratban megjelent DreamerV3 az ötletet általános célú algoritmussá fejlesztette. Egyetlen beállítással több mint 150 feladatban verte meg az egy-egy feladatra szabott módszereket, és ez volt az első algoritmus, amely úgy gyűjtött gyémántot a Minecraftban, hogy nulláról indult és csak a saját tapasztalatából tanult.
Az utódja, a Dreamer 4 ugyanezt már pusztán rögzített játékfelvételekből tanulta meg, és századannyi adat is elég volt neki, mint amennyi az OpenAI egy korábbi ágensének kellett. A szerzők szerint ennek a robotikában van igazán jelentősége, ahol a valódi gépeken lassú és veszélyes a próbálgatás.
Második út: a gép videókból figyeli meg a világot
Videófelvétel rengeteg van, és jól megmutatja, hogyan mozognak és hatnak egymásra a tárgyak. A Meta a V-JEPA 2 nevű, 1,2 milliárd paraméteres világmodellt több mint 1 millió órányi videón és 1 millió képen tanította. A modell nem képpontonként jósol, hanem a jelenet tömörített leírásával dolgozik, a finom részleteket elhagyja; ezt az elvet Yann LeCun 2022-ben vetette fel, és ma a saját startupja, az AMI Labs is ezen az úton halad.
Az előtanítás után a modellnek már 62 órányi robotadat is elég volt a tervezéshez. A modell számára ismeretlen környezetben a robotkaroknak az esetek 65 és 80%-a között sikerült felvenniük és lerakniuk az addig nem látott tárgyakat.
Harmadik út: a gép maga állítja elő a világot
A harmadik úton a gép magát a világot állítja elő. A Google DeepMind Genie 3 modellje szöveges utasításból olyan interaktív környezetet hoz létre, amelyben valós időben lehet mozogni, 720p felbontásban, másodpercenként 24 képkockával. A nehézséget az jelenti, hogy a világ egyben maradjon. Minden képkocka az előzőre épül, ezért az apró hibák továbbgyűrűznek, és a Genie 3 világai néhány percig maradnak többé-kevésbé egyben.
Az NVIDIA Cosmos modelljeit 20 millió órányi videón tanították, emberi tevékenységről, ipari környezetről, robotokról és közúti helyzetekről készült felvételeken; a modellek robotok és önvezető járművek tanításához állítanak elő szintetikus felvételeket.
Mindhárom út ugyanabból tanul: nyers megfigyelésekből és a hozzájuk tartozó cselekvésekből. Ezért a cégeknél is a saját adat a kiindulópont.
Ahol a világmodellek már ma hasznot hoznak
Ma az önvezető autózás a legkézzelfoghatóbb példa. A Waymo Driver közel 200 millió mérföldet tett meg közutakon, teljesen önvezető üzemmódban, szimulációban pedig további milliárdokat. 2026 februárjában a Waymo bemutatta a Genie 3-ra épülő szimulátorát, amely ritka eseményeket is előállít, a tornádótól az úton álló elefántig; ilyen helyzetekből a flotta a valóságban alig tud eleget összegyűjteni.
A Waymo szerint a legtöbb ilyen szimulátort kizárólag a saját flotta közúti adatain tanítják, ezért csak azt ismerik, amivel a flotta már találkozott.
Ugyanez a minta ismétlődik a robotikában és az ipari képfeldolgozásban. Az NVIDIA 2026 májusában kiadott Cosmos 3 modellje már termékhibákról is készít képeket; a cég szerint ezzel a tanítás és a kiértékelés hónapok helyett napokig tart. Ez azonban gyártói állítás; a saját adatain érdemes ellenőrizni.
A magyar olvasóhoz a debreceni példa áll a legközelebb. A BMW szerint ez a csoport első olyan üzeme, amelyet teljes egészében virtuálisan terveztek meg és validáltak, az NVIDIA Omniverse platformra épülő digitális ikerben. A digitális ikret tervezési adatokból és ismert fizikai törvényekből építik fel; a világmodell viszont megfigyelésből tanulja meg a szabályokat. A két világ kezd összeérni, hiszen a Cosmos az Omniverse-ben épített 3D-s jelenetekből is készít szintetikus videót.
Ezeken a szűk alkalmazási területeken túl a piac még gyerekcipőben jár. A TechCrunch 2026 szeptemberében egy világmodellekről szóló panelbeszélgetésről számolt be, ahol az AMI Labs azt mondta, hogy még a kutatási és fejlesztési szakaszban tart, a termékterveiről pedig nem árult el semmit. A World Labs Marble nevű terméke valószínűleg a legkiforrottabb a mezőnyben, de a bemutatói egyelőre főként médiatartalmak gyártásáról, játékkörnyezetekről és vizuális effektekről szólnak.
A Gartner Hype Cycle for Physical AI, 2026 című jelentése szerint a fizikai AI körül egyelőre több a felhajtás és a kockázat, mint az üzleti eredmény. Az AMI Labs vezérigazgatója, Alexandre LeBrun maga is számított a felhajtásra, amikor bejelentették a tőkebevonást:
“Hat hónap múlva minden cég világmodellnek nevezi majd magát, hogy tőkéhez jusson.”
Alexandre LeBrun, az AMI Labs vezérigazgatója (TechCrunch, 2026. március)
A felkészülés a saját adatoknál kezdődik
A legtöbb középvállalat valószínűleg kész termékekben találkozik majd először világmodellel: robotban, ellenőrző kamerában, tervezőeszközben vagy szimulációs szolgáltatásban. A felkészülésből az térül meg, amit a saját adatokra fordítanak. A Gartner szerint a fizikai AI egyik legfőbb korlátja, hogy kevés a valós adat; a tanácsadó cég azt javasolja az AI-ért felelős vezetőknek, hogy tegyék rendbe a szenzor- és OT/IoT-platformjaikat.
Ez a felkészülés azzal kezdődik, hogy egyértelmű legyen, milyen adatok állnak rendelkezésre, ki felel értük, és mennyire megbízhatóan kapcsolhatók össze a különböző rendszerek között. Erről bővebben: Miért buknak el az AI-projektek data governance nélkül →
A fenti módszerek mindegyike ugyanabból a három dologból tanul: milyen volt a helyzet, mit tettek, és mi történt utána. Képzelje el, hogy a szenzoradatok az adatbázisban, a munkalapok a karbantartási rendszerben, a minőségi eredmények pedig Excel-táblában vannak, és mindegyiknek más az órája. Amíg ezek az órák nem járnak együtt, egyetlen modell sem tudja összekapcsolni a beavatkozást a hatásával.
Öt ellenőrzés, mielőtt elhinné, amit az AI a működéséről mutat
1. A kerülőút-teszt.
Minden AI-rendszert nemcsak átlagos napokon, hanem megváltozott körülmények között is teszteljen: új termékváltozattal, leállított gyártósorral vagy új beszállítóval.
2. Állapot, beavatkozás, eredmény.
Ellenőrizze, hogy az adataiból összekapcsolható-e, milyen volt a helyzet, mit tettek és mi történt utána, és hogy a különböző rendszerek időbélyegei egyeznek-e.
3. Ritka események.
Írja össze azokat a hibákat, amelyek a legtöbbe kerülnek, de a legritkábban fordulnak elő. Ezeknél éri meg a szimuláció és a szintetikus adat, és ezeknél a leggyengébb az a modell, amely csak átlagos napokat látott.
4. A gyártó világa.
Kérdezze meg, milyen adatokból tanult a modell, meddig maradnak egyben a szimulációi, és hogyan teljesített olyan helyzetekben, amilyeneket a tanítás során nem látott.
5. Az emberi jóváhagyás.
Döntse el, hol kell egy embernek jóváhagynia a tervet, mielőtt az eljut a valódi gépekig.
Ha erre az öt kérdésre világos válasza van, felkészülten várhatja a világmodellre épülő eszközöket, mire azok kiforrnak. Ugyanez az adatmunka a már ma bevezethető AI-nak is jót tesz, a vizuális minőség-ellenőrzéstől a karbantartás előrejelzéséig.
A következő lépés a saját működés térképe
A taxis modell megtanulta az útvonalakat, a várost mégsem értette. A világmodellek magát a várost akarják megtanulni: az utcáit, a szabályait, és azt, hogy mi történik, ha lezárnak egy utat. A kutatás gyorsan halad, a kereskedelmi piac viszont még csak most formálódik.
A legtöbbet a cége ennél jóval közelebb, házon belül tehet. A világmodell csak abból tanul, ami az adataiban benne van. Kezdje tehát azzal, hogy a saját működését követhetővé teszi az adatokban: kapcsolja össze, mi történt, mit tettek és mi lett a következménye, és minden AI-rendszert a kerülőutakon is tesztelje, ne csak a megszokott útvonalakon.
A saját működésének térképét már ma elkezdheti megrajzolni.
Hol a helye ennek a technológiának a cége működésében?
Hasznos első lépés, ha érti, mit tud a technológia. A cégének viszont az a kérdés, hol teremt üzleti értéket, és ez attól függ, hogyan működik a saját szervezete. Kezdje egy ingyenes, 30 perces konzultációval, amelyen közösen tisztázzuk, van-e helye az itt leírt technológiának a működésében, és ha igen, melyik első lépésnek van értelme.
Források
BMW Group. (2023, March 21). BMW Group at NVIDIA GTC: Virtual production under way in future plant Debrecen. Source of the example of BMW’s Debrecen plant being planned and validated completely virtually before physical production began. Cikk megnyitása →
Gartner. (2026, March 19). Leverage Data and World Models to Advance Physical AI. Source of findings on limited real-world data as a constraint for physical AI and the role of sensor and OT/IoT platforms. Cikk megnyitása →
Gartner. (2026, July 16). Hype Cycle for Physical AI, 2026. Source of Gartner’s assessment that hype and risk around physical AI currently outweigh demonstrated business outcomes. Cikk megnyitása →
Google DeepMind. (2025, August 5). Genie 3: A New Frontier for World Models. Source of the world-model definition, Genie 3’s 24 fps 720p generation, short-term consistency, and accumulating-error limitations. Cikk megnyitása →
Ha, D., & Schmidhuber, J. (2018). World Models. arXiv. Source of the early world-model concept in which an agent can be trained entirely inside a simulated “dream” generated by its own learned model. Cikk megnyitása →
Hafner, D., Pasukonis, J., Ba, J., & Lillicrap, T. (2025, April). Mastering Diverse Control Tasks Through World Models. Nature. Source of DreamerV3 results across more than 150 tasks using one configuration, including obtaining diamonds in Minecraft without human data. Cikk megnyitása →
Hafner, D., Yan, W., & Lillicrap, T. (2025, September). Training Agents Inside of Scalable World Models. arXiv. Source of Dreamer 4, its use of offline data, its reported data efficiency relative to OpenAI’s VPT agent, and the robotics rationale for scalable world models. Cikk megnyitása →
Meta AI. (2025, June 11). Introducing the V-JEPA 2 World Model and New Benchmarks for Physical Reasoning. Source of the internal-simulator framing, V-JEPA 2’s scale and training data, robotic pick-and-place results, and IntPhys 2 performance. Cikk megnyitása →
MIT News. (2024, November 5). Despite Its Impressive Output, Generative AI Doesn’t Have a Coherent Understanding of the World. Source of the navigation experiment showing near-perfect route performance despite incoherent internal street maps, including the drop in accuracy when only 1% of streets were closed. Cikk megnyitása →
NVIDIA. (2025, January 6). NVIDIA Makes Cosmos World Foundation Models Openly Available to Physical AI Developer Community. Source of details on Cosmos training data, including 20 million hours of video and synthetic video generated from Omniverse scenes. Cikk megnyitása →
NVIDIA. (2026, May 31). NVIDIA Launches Cosmos 3, the Open Frontier Foundation Model for Physical AI. Source of Cosmos 3 use cases such as defect-image generation and NVIDIA’s claim of reducing development timelines from months to days. Cikk megnyitása →
TechCrunch. (2026, March 9). Yann LeCun’s AMI Labs Raises $1.03B to Build World Models. Source of funding information on AMI Labs and World Labs and comments on the emerging world-model market. Cikk megnyitása →
TechCrunch. (2026, September 18). World Model Companies Are Keeping a Lot of Secrets. Source of the current development status of major world-model companies, including AMI Labs’ research phase and Marble as one of the most developed products. Cikk megnyitása →
Vafa, K., Chen, J., Rambachan, A., Kleinberg, J., & Mullainathan, S. (2024). Evaluating the World Model Implicit in a Generative Model. NeurIPS 2024. Source of the New York taxi-route experiments, including impossible street orientations and flyover-like internal representations. Cikk megnyitása →
Vafa, K., Chang, J., Rambachan, A., & Mullainathan, S. (2025). What Has a Foundation Model Found? Using Inductive Bias to Probe for World Models. ICML 2025. Source of the orbital-trajectory experiments, the emergence of a nonsensical force law, and the comparison with Keplerian and Newtonian structure. Cikk megnyitása →
Waymo. (2026, February 6). The Waymo World Model: A New Frontier for Autonomous Driving Simulation. Source of Waymo’s world-model simulator, its use of Genie 3, rare-event generation, nearly 200 million autonomous miles of experience, and the limitations of relying only on fleet-collected data. Cikk megnyitása →

Fekszi Csaba
Fekszi Csaba informatikai szakértő, több mint két évtizedes tapasztalattal az adatmérnökség, a rendszerarchitektúra és az Mesterséges Intelligencia alapú folyamatoptimalizálás területén. Munkájának középpontjában olyan skálázható megoldások tervezése áll, amelyek mérhető üzleti értéket teremtenek.
Kapcsolódó cikkek

Miért nem szabad összekeverni a ChatGPT-t az Mesterséges Intelligenciával

Miért akad el olyan sok AI-projekt — és hogyan léphetsz végre túl a pilot fázison

Hol teremt értéket a videóelemzés az operatív működésben
Biztos benne, hogy az AI a megfelelő következő lépés?
Segítünk feltárni a valódi lehetőségeket, korlátokat és a reális következő lépéseket.

