Skip to main content
közigazgatás: külföldönMesterséges Intelligencia (MI)technikatudomány

Miért van szükség saját nemzeti nyelvi modellre? – a lengyel válasz

By 2026. szeptember 27.No Comments

„Miért van szükség saját nemzeti nyelvi modellre akkor, amikor a ChatGPT-hez és más globális AI-rendszerekhez bárki hozzáférhet? A lengyel Bielik fejlesztői szerint a válasz nem pusztán a nyelvi minőségben rejlik: legalább ilyen fontos az adatszuverenitás, a biztonság és az, hogy a technológiai tudás Európában maradjon. Pawel Kiszczak és Maciej Szymanski az Economxnak arról is beszélt, mit kellene tennie Magyarországnak, ha saját, erős magyar nyelvi modellt szeretne fejleszteni.

Az AI Summit 2026 Budapesten az Economx Pawel Kiszczakkal, a Bielik.AI közreműködőjével és a Bielik-Minitron-7B egyik fejlesztőjével, valamint Maciej Szymanskival, a projekt közösségi együttműködésekért felelős vezetőjével beszélgetett. Kiderült többek között, hogy miért van értelme saját lengyel mesterséges intelligenciát fejleszteni a ChatGPT és a Claude korában, mit jelent a gyakorlatban az AI-szuverenitás, hogyan érinti az európai fejlesztőket az AI Act, és az is, mit kellene tennie Magyarországnak, ha egyszer saját nyelvi modell létrehozása mellett döntene.

Miért van szüksége Lengyelországnak saját nyelvi modellre, amikor a lengyel felhasználók ugyanúgy hozzáférnek a nagy globális modellekhez, például a ChatGPT-hez vagy a Claude-hoz? Mit tud kínálni a Bielik, amit ezek a modellek nem?

Pawel Kiszczak: Mindenekelőtt alternatívát ad, egyszerűen van választási lehetőség. A globális modellek természetesen nagyon fejlettek: tudnak keresni, összetett kérdésekre válaszolni, rengeteg különböző feladatot ellátni. Amikor azonban lengyel nyelvű válaszokról van szó, még nem mindig teljesítenek igazán jók. Gyakran látni közvetlen angol fordításokat ahelyett, hogy valóban természetes lengyel nyelven fogalmaznának. Angol szavakat és kifejezéseket használnak, és időnként még a mondatok felépítésén is érződik, hogy az angolból erednek. A Bielik AI megépítése emellett lehetőséget ad számunkra arra is, hogy tapasztalatot szerezzünk, és közvetlen kapcsolatban maradjunk a legújabb technológiával. Bizonyos esetekben nem is kizárólag az a fontos, hogy pontosan mit építünk, hanem maga az, hogy építjük. Így tapasztalatra teszünk szert, és ez a tudás helyben marad, ahelyett, hogy az Egyesült Államokba vagy más országokba kerülne.

Egy másik fontos szempont, hogy a modellünk jóval kisebb. A ChatGPT-t vagy a Claude-ot nem lehet egyszerűen letölteni és a saját számítógépen futtatni, a Bieliket és más nyílt (open-source) modelleket viszont igen. Mivel a Bielik kifejezetten jól teljesít a lengyel nyelv megértésében és feldolgozásában, nagyon hatékonyan használható például a lengyel joghoz vagy egészségügyi dokumentumokhoz kapcsolódó feladatokra. Ilyen alkalmazásokban már tesztelték is, ráadásul mivel a modell letölthető és helyben futtatható, az érzékeny adatokat nem kell elküldeni a felhőbe. Mára ott tartunk, hogy valamennyi lengyel pénzügyi intézet jogi csapata előszeretettel használja.

Vagyis a modell kisebb mérete akár előnyt is jelenthet?

Pawel Kiszczak: Igen, de fontos világossá tenni, hogy ez természetesen nem old meg minden problémát. Nemrég láttam egy kutatást, amelyben nyílt modellek és a legfejlettebb modellek válaszait hasonlították össze. A feladattól függően a felhasználók sok esetben nem tudták megmondani, hogy melyik válasz melyik modelltől származott, az adott összehasonlításban az esetek nagyjából 80 százalékában. Ez azt mutatja, hogy a kisebb modellek sok hétköznapi feladathoz megfelelően jó eredményt tudnak adni: viszonylag egyszerű szövegek megírásánál, következetlenségek keresésénél, osztályozásnál és hasonló feladatoknál. A legtöbben nem írunk mindennap ötvenoldalas esszéket, hanem egyszerű, ismétlődő feladatokat végzünk, ezekben pedig a kisebb modellek nagyon jók lehetnek.

Jelenleg mi a Bielik legerősebb felhasználási területe?

Maciej Szymanski: Nagyon sok különböző területen használható. Az egyik példa az InPost, a nagy lengyel logisztikai vállalat, amely a saját alkalmazásához kapcsolódóan használja a Bieliket. Egy másik fontos terület a pénzügyi szektor. A Bielik segítségével rendkívül érzékeny adatokat is fel lehet dolgozni zárt infrastruktúrán belül, vagyis az adott intézmény saját számítógépein, azaz a rendszerünk adatszuverén módon működik, ami az érzékeny információkkal dolgozó ágazatoknál fontos szempont a modellek kiválasztásánál. Dokumentumokat és fájlokat elemezhet a Bielik úgy, hogy az információk nem hagyják el az intézmény infrastruktúráját.

Pawel Kiszczak: Ráadásul az adatokat nem feltétlenül kell előzetesen anonimizálni, hiszen el sem hagyják a számítógépet. A Bielik-et nagy mennyiségű nyilvánosan hozzáférhető lengyel jogi dokumentummal tanítottuk, bírósági ítéletekkel és hasonlókal, ez az oka annak, hogy a jogi területen különösen jól használható. Nagyon érdekes visszajelzést kaptunk egy legal-tech startuptól, amely a Bielik V2 egyik korai felhasználója volt. A modell megjelenésének estéjén, 2024 augusztusának végén megkerestek minket azzal, hogy: „Srácok, van egy problémánk.” Mi azt hittük, hogy valami elromlott. Ehelyett azt mondták, hogy a Bielik „szétverte” a benchmarkjaikat, mert a méretéhez képest sokkal jobban teljesített, mint amire számítottak. Jelenleg a háttérfolyamataik mintegy 70-80 százalékában használják a Bieliket. Ezeknél a feladatoknál olcsóbb, biztonságosabb és gyorsabb lehet, mint egy nagy modell. Ilyenkor felmerül a kérdés: miért használnánk a nagyobb modellt, ha nincs rá szükség? Ez egyben lehetővé teszi a vállalatok számára, hogy olyan megoldásokat kínáljanak, amelyek lényegében ott lehetnek a saját asztalukon. Semmit nem kell elküldeni a felhőbe, így a rendszer a lehető legnagyobb biztonságot kínálhatja.

Amikor technológiai vagy MI-szuverenitásról beszélnek, mit jelent ez a gyakorlatban? Adatszuverenitást, infrastruktúrát, nyelvi és kulturális önállóságot, vagy inkább azt, hogy csökkentsék az amerikai technológiai vállalatoktól való függőséget?

Maciej Szymanski: Érdemes elképzelni egy olyan helyzetet, amelyben a mesterséges intelligencia a vállalat működésének standard részévé válik. Lehetséges például, hogy elemzi az összes e-mailt, vagy valamilyen más alapvető feladatot lát el. Ezután képzeljük el, hogy az amerikai – vagy a jövőben akár egy kínai – szolgáltató egyszerűen kihúzza a dugót, négyszeresére emeli az árat, vagy történik valami azzal az adatközponttal, ahol a modellt futtatják. Hirtelen akár a fél világ elveszítheti a hozzáférését egy olyan eszközhöz, amelyet már egy éve problémamentesen használ. A szolgáltató ráadásul egyszerűen megváltoztathatja azt is, hogyan működik a modell. Ha tehát teljes egészében valaki más technológiájától függünk, és nem teremtünk saját szellemi tulajdont vagy technológiai képességeket, az kockázatot jelent. Az én szemszögemből már az is technológiaépítésnek számít, ha nyílt modelleket használunk, és saját megoldásokat építünk rájuk. Ez arra is rákényszerít bennünket, hogy elgondolkodjunk azon, hogyan lehet valóban használni a mesterséges intelligenciát, ahelyett, hogy egyszerűen csak használnánk egy mások által elénk tett chatalkalmazást.

Pawel Kiszczak: Van egy másik szempont is. Már láttuk, hogy a felhasználók nagyon erősen tiltakozhatnak, amikor egy általuk kedvelt modellt kivezetnek vagy egy újabb verzióval helyettesítenek. Ha egy nyílt modellt letöltünk és a saját infrastruktúránkon használunk, akkor amíg mi magunk nem változtatunk rajta, ugyanaz marad. Ha viszont egy kereskedelmi szolgáltatásra támaszkodunk, azt folyamatosan frissítik. Amennyiben nem követjük ezeket a változtatásokat, könnyen előfordulhat, hogy hirtelen jelentősen megváltozik a modell viselkedése, és ezzel együtt az alkalmazásunk által előállított eredmények minősége is. Ez további karbantartási feladatot jelent. Egy saját ellenőrzés alatt álló modell viszont a termék életciklusának elejétől a végéig ugyanúgy működhet.

Az EU AI Act könnyebbé vagy nehezebbé teszi az olyan európai nyílt mesterségesintelligencia-projektek helyzetét, mint a Bielik?

Pawel Kiszczak: Ez egy nehéz kérdés. Vannak dolgok, amelyeket jól csinál, és vannak, amelyeket kevésbé. Európában időnként megpróbálunk az „eminensek” lenni: minden szabályt betartunk, miközben egyszerre akarunk innoválni és szabályozni. Szerintem valamivel dinamikusabbnak és rugalmasabbnak kellene lennünk. Meg kell néznünk, mit csinál a világ többi része, mi mit szeretnénk elérni, és hogyan lehet ezt a két dolgot összehangolni. Az Egyesült Államokban gyakran előbb megcsinálnak valamit, és csak utána kezdenek aggódni a következmények miatt. Ez sem feltétlenül a legjobb megközelítés. Minél többet beszélünk azonban ezekről a kérdésekről, annál könnyebb lesz kezelni a kihívásokat és megtalálni a legjobb megoldást. Mi a saját esetünkben igyekszünk a lehető legjobban megfelelni az AI Act előírásainak.

Maciej Szymanski: Az AI Act kétségtelenül okozott számunkra bizonyos kihívásokat, ugyanakkor arra is ösztönzött minket, hogy a lehető legtisztábbá tegyük az adatforrásainkat. Dokumentálni kell például, hogy honnan származnak az adatok, mire használtuk őket, és körülbelül mekkora mennyiségben. Ennek eredményeként a dokumentációnk mára rendkívül részletessé vált, ez transzparencia a felhasználó felé is egy etikusabb megoldás, mert a felhasználó tudja, honnan van az adat.

De vannak az AI Actnek olyan részei is, amelyeket kifejezetten jónak tartok. Ilyen például a mesterséges intelligenciával kapcsolatos ismeretek, vagyis az AI oktatás hangsúlyozása. A vállalatoknak meg kell tanítaniuk az alkalmazottaikat az MI használatára, és segíteniük kell nekik megérteni, hogy mi történik, miért történik, és hogyan működnek ezek a rendszerek. Az oktatás kulcsfontosságú. Az embereknek meg kell érteniük például azt is, hogy egy mesterséges intelligencia által adott válasz nem feltétlenül helyes. A magasabb szintű AI literacy lehetővé teheti, hogy az emberek biztonságosabban építsenek és használjanak ilyen rendszereket. A kockázati besorolás gondolatát is jónak tartom, még ha a megvalósítása nehéz is. Az embereket pontozó vagy például az egészségügy területén működő alkalmazások közvetlenül befolyásolhatják az életünket. Ha például egy mesterséges intelligencia egészségügyi kérdésben tesz ajánlást, az ilyen alkalmazásokat egyértelműen szabályozni kell.

Pawel Kiszczak: Szabályozásra szükség van, de arra is vigyáznunk kell, hogy ne vesszünk el közben benne. A mesterséges intelligencia rendkívül erős az adatok feldolgozásában és a mintázatok felismerésében, és sokkal több információt képes feldolgozni, mint egy ember. Jelenleg szerintem az a legjobb megközelítés, ha hagyjuk, hogy segítsen nekünk, de nem engedjük, hogy helyettünk döntsön. Az MI által adott eredményt a saját tudásunkkal és tapasztalatunkkal együtt használjuk. Ha valaki orvos, kutató vagy akár fejlesztő, és rendelkezik a szükséges szakértelemmel, akkor meg tudja ítélni, hogy a rendszer jól dolgozott-e, elfogadhatja az eredményt, ha megfelelő, vagy a saját tudásával tovább javíthatja.

Ha Magyarország egy Bielikhez hasonló rendszert szeretne fejleszteni, mit tanácsolnának a döntéshozóknak és a kutatóknak? Mi lenne az első dolog, amit meg kellene tenniük?

Pawel Kiszczak: Lehet, hogy ez nem túl népszerű vélemény, de azt mondanám, hogy egy modell sikere az alkotói hozzáálláson túl 80 százalékban az adatokon múlik. És minél korábban kezdenek hozzá, annál jobb. Mi majdnem négy éve kezdtük, és az elején naivan álltunk hozzá: egyszerűen adatokat gyűjtöttünk, megnéztük, hogy hol találhatók, és milyen formában érhetők el. Minél korábban kezdjük azonban megérteni, hogy milyen adatok állnak rendelkezésre, mit jelent valóban a jó minőségű adat, és milyen a rossz adat, annál jobb. Ez egyáltalán nem egyszerű feladat. Az egyik kollégánk például készített egy olyan eszközt, amely megvizsgálja, hogy egy adathalmaz vagy dokumentum elég jó-e ahhoz, hogy tanításra használjuk. Körülbelül száz különböző jellemző alapján értékeli egy szöveg minőségét. A tanácsom tehát az lenne: minél hamarabb kezdjék el. A magyar kollégáknak azt mondanánk, ne foglalkozzanak túl sokat mások véleményével, tartsák szem előtt a célt, és szálljanak fel erre a vonatra, érdemes.

Maciej Szymanski: Magyarország számára ez nehéz lehet, mert elképzelhető, hogy egyszerűen nincs elegendő jó minőségű magyar nyelvű adat. Lengyelországban is szembesültünk hasonló problémákkal. A másik fontos kérdés a hozzáférés. Ha valaki ezt komolyan akarja csinálni, szükség van egy olyan csapatra, amely mögött tényleges állami támogatás áll, és amely képes megnyitni azokat az ajtókat, amelyek mögött értékes adathalmazok találhatók. Rengeteg jó minőségű adat van elzárva. A probléma az, hogy sok olyan intézmény, amely rendelkezik ezekkel, nincs tisztában az értékükkel. Az adat lényegében korunk aranya. Van emellett egy másik kihívás is. Azok a szervezetek, amelyek már értik, mi történik, egyre inkább külön kezelik az ember által létrehozott adatokat, mert ma már rendkívül sok MI által generált tartalom létezik. Az MI által előállított adatnak nem feltétlenül ugyanaz az értéke a modellek tanítása szempontjából.

Pawel Kiszczak: Ez az egyik oka annak is, hogy a vízjelezés ennyire fontos témává vált. Ha sikerül megbízhatóvá tenni, és valóban úgy működik majd, ahogyan szeretnénk, sokkal könnyebb lesz megkülönböztetni az MI által létrehozott és az ember által készített tartalmakat.

Hol szeretnék látni a Bieliket három év múlva? A lengyel digitális infrastruktúra meghatározó részévé válhat?

Pawel Kiszczak: Mindenképpen azzá válhat. Eddig két különböző ambíciójú generációt hoztunk létre. A Bielik V2 elsősorban Lengyelországra és a lengyel nyelvre koncentrált, míg a V3 már az európai nyelvek felé nyitott, és összesen 32 nyelvet foglal magában. Bizonyos értelemben kiléptünk Európa elé, és azt mondtuk: „mi is tudunk modelleket építeni, nézzetek ránk”. Hosszabb távon szeretném, ha lenne multimodális modellünk, amely például látni is képes.

Az architektúrát is szeretnénk modernebbé tenni. Jelenleg még sűrű, úgynevezett dense modellarchitektúrára támaszkodunk, így a jövőben elképzelhető lenne az úgynevezett mixture-of-experts, vagyis szakértői modellekből felépülő architektúra használata. Véleményem szerint ez jelenleg az egyik legérdekesebb irány a modellarchitektúrák között, mert ezek a rendszerek nagyon hatékonyak és gyorsak lehetnek. Azt szeretném tehát, hogy a Bielik több modalitással rendelkezzen, miközben a mögöttes architektúrát is folyamatosan modernizáljuk.

Maciej Szymanski: És marad az eredeti célunk, ha úgy tetszik küldetésünk, hogy olyan megoldásokat hozzunk létre, amelyek valóban jót tesznek az embereknek. Meg kell mutatnunk, hogy a mesterséges intelligencia nem csak ellenség lehet. Olyan hasznos közszolgáltatásokat is létrehozhatunk vele, amelyek időt takarítanak meg és megkönnyítik az életüket. Segíthet például azoknak, akik valamilyen hozzáférési nehézséggel küzdenek, összetett információk megértésében vagy a bonyolult nyelvezet egyszerűbb, közérthetőbb formába történő átültetésében. Szerintem erre a fajta mesterséges intelligenciára kellene koncentrálnunk: olyan dolgokra, amelyek valóban hasznosak, ahelyett hogy kizárólag optimalizációról, munkahelyek megszűnéséről vagy vicces képek gyártásáról beszélnénk. Már most is vannak olyan szervezetek, amelyek ebben az irányban dolgoznak. A Tech To The Rescue például lengyel civil szervezetekkel dolgozott együtt olyan technológiai megoldásokon, amelyek a demokráciához kapcsolódnak: például annak ellenőrzésén, hogy a politikusok teljesítették-e az ígéreteiket, milyen valótlanságokat állítottak, vagy milyen kapcsolatok vannak közöttük. Érdekes lenne ezt például Magyarországon is megnézni, vajon az április 12-i választás után felállt új kormány milyen ütemben, hogyan teljesíti a korábban tett ígéreteit. Többek között ezek azok a kezdeményezések, amelyekben szerintem nekünk is érdemes részt vennünk és együtt dolgoznunk akár a magyar szakemberekkel is.

Maciej Szymanski előadása az AI Summit Budapest 2026 konferencián”

Forrás:
A lengyelek saját AI-t építettek, Magyarországnak is van egy fontos tanácsuk: érdemes felszállni erre a vonatra; Vermes Ádám; Economx; 2026. szeptember 23.
Bielik.AI – Trusted Open‑Science AI for Everyone in Europe
Polish LLMs; Academic Computer Centre CYFRONET of the AGH University of Krakow