Bielik PL v3 – polskie modele językowe z dedykowanym tokenizerem
Aktualności

Bielik PL v3 – polskie modele językowe z dedykowanym tokenizerem premiera na KUKDM 2026

14 kwietnia 2026 na konferencji KUKDM w Zakopanem zespół Bielik AI zaprezentował dwa nowe modele z polskim tokenizerem: Bielik-PL-11B-v3.0 i Bielik-PL-Minitron-7B-v3.0. Pierwsze polskie LLM-y z własnym słownikiem tokenów.

14 kwietnia 2026 roku na 18. Konferencji Użytkowników Komputerów Dużej Mocy (KUKDM 2026) w Zakopanem zespół Bielik AI zaprezentował dwa nowe modele językowe z dedykowanym, polskim tokenizerem. To przełomowy krok dla polskiego AI – pierwsze LLM-y zoptymalizowane pod kątem języka polskiego od poziomu tokenizacji.

Bielik PL v3 – polskie modele językowe z dedykowanym tokenizerem

Co to jest Bielik?

Bielik to polski projekt open-source tworzący modele językowe (LLM) zoptymalizowane pod kątem języka i kontekstu polskiego. Jest rozwijany przez Fundację SpeakLeash we współpracy z ACK Cyfronet AGH i społecznością. Modele Bielik są dostępne na licencji Apache 2.0 – można je pobierać, używać komercyjnie i uruchamiać lokalnie, bez chmury.

W EuroEval Multilingual Leaderboard Bielik zajmuje 6. miejsce globalnie wśród modeli bazowych i jest pierwszym niezależnym modelem na liście – wyprzedzając modele od Google, Meta i innych gigantów.

Premiera na KUKDM 2026

Prezentacja odbyła się 14 kwietnia o godz. 10:35 w ramach sesji „Optymalizacja architektury w modelach Bielik", którą wygłosili Krzysztof Ociepa i Krzysztof Wróbel z zespołu Bielik AI. Konferencja KUKDM, organizowana przez Akademickie Centrum Komputerowe Cyfronet AGH, odbyła się w dniach 13–15 kwietnia 2026 w Hotelu Bachleda Kasprowy w Zakopanem.

Zaprezentowano dwa modele:

  • Bielik-PL-11B-v3.0-Instruct – 11 miliardów parametrów, pełny model z polskim tokenizerem
  • Bielik-PL-Minitron-7B-v3.0-Instruct – 7 miliardów parametrów, skompresowany wariant powstały przez structured pruning i knowledge distillation

Dlaczego polski tokenizer ma znaczenie?

Dotychczasowe modele Bielik korzystały z uniwersalnego tokenizera Mistral, zaprojektowanego dla wielu języków. To prowadziło do wyższych współczynników fragmentacji tekstu polskiego – polskie słowa były dzielone na więcej tokenów niż konieczne. Skutkowało to zwiększonymi kosztami inferencji, wolniejszym generowaniem i ograniczonym efektywnym oknem kontekstowym.

Nowy, dedykowany tokenizer zoptymalizowany dla języka polskiego rozwiązuje ten problem. Modele przetwarzają polski tekst bardziej efektywnie – mniej tokenów na to samo zdanie oznacza szybszą pracę, niższe koszty i większe efektywne okno kontekstowe.

Pipeline treningowy

Nowe modele wykorzystują inicjalizację embeddingów opartą na metodzie FOCUS, wieloetapowy program pretreningu oraz zaawansowany pipeline post-treningowy obejmujący:

  • Supervised Fine-Tuning (SFT) – dostrajanie nadzorowane
  • Direct Preference Optimization (DPO) – optymalizacja preferencji
  • Group Relative Policy Optimization (GRPO) z weryfikowalnymi nagrodami – uczenie ze wzmocnieniem

Wyniki benchmarków

Model Bielik-11B-v3.0-Instruct osiąga wynik 65,93 w średniej 5-shot na Open LLM Leaderboard, plasując się wśród czołowych modeli i wyprzedzając znacznie większe rozwiązania, takie jak Meta-Llama-3.1-70B-Instruct.

Warianty z polskim tokenizerem uzyskują wyniki 64,11 (Bielik-PL-11B) oraz 61,66 (Bielik-PL-Minitron-7B), co potwierdza, że optymalizacja tokenizera nie odbywa się kosztem jakości modelu. W testach specjalistycznych dla języka polskiego, w tym w Polish Medical Benchmark, model 11B osiągnął znaczącą poprawę względem wersji bazowej.

Kompresja bez utraty jakości

Model Bielik-PL-Minitron-7B powstał w wyniku kompresji wariantu 11B z wykorzystaniem technik structured pruning i knowledge distillation, opracowanych we współpracy z inżynierami NVIDIA. Dzięki temu udało się osiągnąć:

  • Redukcję rozmiaru modelu o 33%
  • Do 50% szybszą inferencję
  • Zachowanie ok. 90% jakości pełnego modelu

Metoda ta została po raz pierwszy zaprezentowana podczas NVIDIA GTC w marcu 2026. Współpraca z NVIDIA obejmowała wykorzystanie technik Minitron oraz bibliotek NVIDIA NeMo.

„Nasza praca z inżynierami NVIDIA udowadnia, że wysokowydajne AI może być zarówno efektywne, jak i dostępne. Wykorzystanie techniki Minitron pozwoliło nam zbudować model, który jest niezwykle dokładny, a jednocześnie smukły. To technologiczny fundament dla Bielik, aby stać się modelem pierwszego wyboru w całej Europie – ekonomicznie zrównoważonym, otwartym i zbudowanym w Europie."

- Sebastian Kondracki, CEO Bielik.ai

Publikacja naukowa

Szczegóły techniczne nowych modeli zostały opisane w publikacji „Advancing Polish Language Modeling through Tokenizer Optimization in the Bielik v3 7B and 11B Series", opublikowanej 12 kwietnia 2026 na platformie arXiv (ID: 2604.10799). Autorami pracy są Krzysztof Ociepa, Łukasz Flis, Remigiusz Kinas, Krzysztof Wróbel i Adrian Gwoździej. Wagi modeli zostały udostępnione na licencji Apache 2.0.

Dlaczego to ważne dla Polski?

Bielik to koncepcja „Open Sovereign AI" – przezroczystych, otwartych modeli, które mogą być inspekcjonowane, dostosowywane i wdrażane lokalnie przez europejskie instytucje i firmy, zachowując pełną kontrolę nad wrażliwymi danymi. W kontekście rosnącej roli AI w biznesie, administracji, ochronie zdrowia, edukacji i finansach, posiadanie własnego, polskiego modelu językowego ma znaczenie strategiczne.

Nowy tokenizer to nie tylko techniczna optymalizacja – to dowód, że polskie modele mogą konkurować z globalnymi liderami, oferując jednocześnie lepsze zrozumienie języka polskiego, niższe koszty i niezależność od zagranicznych dostawców.