
Bielik PL v3 – polskie modele językowe z dedykowanym tokenizerem premiera na KUKDM 2026
14 kwietnia 2026 na konferencji KUKDM w Zakopanem zespół Bielik AI zaprezentował dwa nowe modele z polskim tokenizerem: Bielik-PL-11B-v3.0 i Bielik-PL-Minitron-7B-v3.0. Pierwsze polskie LLM-y z własnym słownikiem tokenów.
14 kwietnia 2026 roku na 18. Konferencji Użytkowników Komputerów Dużej Mocy (KUKDM 2026) w Zakopanem zespół Bielik AI zaprezentował dwa nowe modele językowe z dedykowanym, polskim tokenizerem. To przełomowy krok dla polskiego AI – pierwsze LLM-y zoptymalizowane pod kątem języka polskiego od poziomu tokenizacji.
Co to jest Bielik?
Bielik to polski projekt open-source tworzący modele językowe (LLM) zoptymalizowane pod kątem języka i kontekstu polskiego. Jest rozwijany przez Fundację SpeakLeash we współpracy z ACK Cyfronet AGH i społecznością. Modele Bielik są dostępne na licencji Apache 2.0 – można je pobierać, używać komercyjnie i uruchamiać lokalnie, bez chmury.
W EuroEval Multilingual Leaderboard Bielik zajmuje 6. miejsce globalnie wśród modeli bazowych i jest pierwszym niezależnym modelem na liście – wyprzedzając modele od Google, Meta i innych gigantów.
Premiera na KUKDM 2026
Prezentacja odbyła się 14 kwietnia o godz. 10:35 w ramach sesji „Optymalizacja architektury w modelach Bielik", którą wygłosili Krzysztof Ociepa i Krzysztof Wróbel z zespołu Bielik AI. Konferencja KUKDM, organizowana przez Akademickie Centrum Komputerowe Cyfronet AGH, odbyła się w dniach 13–15 kwietnia 2026 w Hotelu Bachleda Kasprowy w Zakopanem.
Zaprezentowano dwa modele:
- Bielik-PL-11B-v3.0-Instruct – 11 miliardów parametrów, pełny model z polskim tokenizerem
- Bielik-PL-Minitron-7B-v3.0-Instruct – 7 miliardów parametrów, skompresowany wariant powstały przez structured pruning i knowledge distillation
Dlaczego polski tokenizer ma znaczenie?
Dotychczasowe modele Bielik korzystały z uniwersalnego tokenizera Mistral, zaprojektowanego dla wielu języków. To prowadziło do wyższych współczynników fragmentacji tekstu polskiego – polskie słowa były dzielone na więcej tokenów niż konieczne. Skutkowało to zwiększonymi kosztami inferencji, wolniejszym generowaniem i ograniczonym efektywnym oknem kontekstowym.
Nowy, dedykowany tokenizer zoptymalizowany dla języka polskiego rozwiązuje ten problem. Modele przetwarzają polski tekst bardziej efektywnie – mniej tokenów na to samo zdanie oznacza szybszą pracę, niższe koszty i większe efektywne okno kontekstowe.
Pipeline treningowy
Nowe modele wykorzystują inicjalizację embeddingów opartą na metodzie FOCUS, wieloetapowy program pretreningu oraz zaawansowany pipeline post-treningowy obejmujący:
- Supervised Fine-Tuning (SFT) – dostrajanie nadzorowane
- Direct Preference Optimization (DPO) – optymalizacja preferencji
- Group Relative Policy Optimization (GRPO) z weryfikowalnymi nagrodami – uczenie ze wzmocnieniem
Wyniki benchmarków
Model Bielik-11B-v3.0-Instruct osiąga wynik 65,93 w średniej 5-shot na Open LLM Leaderboard, plasując się wśród czołowych modeli i wyprzedzając znacznie większe rozwiązania, takie jak Meta-Llama-3.1-70B-Instruct.
Warianty z polskim tokenizerem uzyskują wyniki 64,11 (Bielik-PL-11B) oraz 61,66 (Bielik-PL-Minitron-7B), co potwierdza, że optymalizacja tokenizera nie odbywa się kosztem jakości modelu. W testach specjalistycznych dla języka polskiego, w tym w Polish Medical Benchmark, model 11B osiągnął znaczącą poprawę względem wersji bazowej.
Kompresja bez utraty jakości
Model Bielik-PL-Minitron-7B powstał w wyniku kompresji wariantu 11B z wykorzystaniem technik structured pruning i knowledge distillation, opracowanych we współpracy z inżynierami NVIDIA. Dzięki temu udało się osiągnąć:
- Redukcję rozmiaru modelu o 33%
- Do 50% szybszą inferencję
- Zachowanie ok. 90% jakości pełnego modelu
Metoda ta została po raz pierwszy zaprezentowana podczas NVIDIA GTC w marcu 2026. Współpraca z NVIDIA obejmowała wykorzystanie technik Minitron oraz bibliotek NVIDIA NeMo.
„Nasza praca z inżynierami NVIDIA udowadnia, że wysokowydajne AI może być zarówno efektywne, jak i dostępne. Wykorzystanie techniki Minitron pozwoliło nam zbudować model, który jest niezwykle dokładny, a jednocześnie smukły. To technologiczny fundament dla Bielik, aby stać się modelem pierwszego wyboru w całej Europie – ekonomicznie zrównoważonym, otwartym i zbudowanym w Europie."
- Sebastian Kondracki, CEO Bielik.ai
Publikacja naukowa
Szczegóły techniczne nowych modeli zostały opisane w publikacji „Advancing Polish Language Modeling through Tokenizer Optimization in the Bielik v3 7B and 11B Series", opublikowanej 12 kwietnia 2026 na platformie arXiv (ID: 2604.10799). Autorami pracy są Krzysztof Ociepa, Łukasz Flis, Remigiusz Kinas, Krzysztof Wróbel i Adrian Gwoździej. Wagi modeli zostały udostępnione na licencji Apache 2.0.
Dlaczego to ważne dla Polski?
Bielik to koncepcja „Open Sovereign AI" – przezroczystych, otwartych modeli, które mogą być inspekcjonowane, dostosowywane i wdrażane lokalnie przez europejskie instytucje i firmy, zachowując pełną kontrolę nad wrażliwymi danymi. W kontekście rosnącej roli AI w biznesie, administracji, ochronie zdrowia, edukacji i finansach, posiadanie własnego, polskiego modelu językowego ma znaczenie strategiczne.
Nowy tokenizer to nie tylko techniczna optymalizacja – to dowód, że polskie modele mogą konkurować z globalnymi liderami, oferując jednocześnie lepsze zrozumienie języka polskiego, niższe koszty i niezależność od zagranicznych dostawców.

