Fundacja SpeakLeash i Akademickie Centrum Komputerowe Cyfronet AGH stworzyły pierwsze w Polsce modele draftowe DFlash dla Bielik.AI. Nowe adaptery – Bielik-11B-v3.0-DFlash i Bielik-Minitron-7B-v3.0-DFlash – przyspieszają generowanie odpowiedzi nawet kilkukrotnie bez utraty jakości.
Podsumowanie
• Bielik-11B-v3.0-DFlash i Bielik-Minitron-7B-v3.0-DFlash – dwa nowe adaptery draftowe
• Technologia DFlash (dekodowanie spekulatywne) – model draftowy proponuje fragmenty, model docelowy weryfikuje
• Współpraca z vLLM i SGLang – środowiska inferencyjne obsługujące DFlash
• Partnerzy strategiczni Bielik.AI: EY, InPost, Deviniti, Dell Technologies
Jak działa DFlash
DFlash to metoda zaawansowanego dekodowania spekulatywnego (ang. speculative decoding), która optymalizuje działanie modeli AI poprzez przyspieszenie generowania odpowiedzi bez pogarszania ich jakości. Technologia polega na połączeniu pracy dwóch modeli – lekkiego modelu draftowego z modelem docelowym. Model draftowy nie proponuje pojedynczych słów, lecz całe fragmenty wypowiedzi, a model docelowy błyskawicznie poddaje je weryfikacji, zamiast tworzyć odpowiedź od podstaw.
– Stworzyliśmy rozwiązanie oparte na algorytmie DFlash, które pozwala znacząco zwiększyć przepustowość inferencji. Jest to szczególnie istotne dla firm budujących produkty AI, które obsługują tysiące użytkowników jednocześnie. Dzięki uruchamianiu Bielika wraz z nowymi modelami draftowymi przedsiębiorstwa będą mogły kilkukrotnie skrócić czas generowania odpowiedzi oraz obniżyć koszty infrastruktury – mówi Krzysztof Ociepa, Head of Model Training w Bielik.AI.
Nowe modele draftowe można pobrać w serwisie Hugging Face: Bielik-11B-v3.0-DFlash oraz Bielik-Minitron-7B-v3.0-DFlash. Nie są przeznaczone do samodzielnego uruchamiania – ich zadaniem jest współpraca z większymi modelami językowymi w środowiskach obsługujących DFlash, takich jak najnowsze wersje vLLM i SGLang.
Ekosystem Bielik.AI
Bielik.AI to model językowy stworzony przez polskich inżynierów i rozwijany przez Fundację SpeakLeash w duchu open science. Obsługuje 32 języki i jest przeznaczony do uruchamiania na własnej infrastrukturze firm i instytucji publicznych, co zapewnia suwerenność technologiczną danych oraz pełną kontrolę nad przetwarzaniem informacji. Partnerami strategicznymi Bielik.AI są EY oraz InPost. Do grona partnerów należą również Deviniti oraz Dell Technologies.
– Publikacja modeli DFlash rozpoczyna kolejny etap rozwoju polskiego ekosystemu modeli językowych Bielik i dowodzi, że innowacje w obszarze wydajności LLM-ów powstają także poza murami globalnych laboratoriów AI – podsumowuje Krzysztof Ociepa z Fundacji SpeakLeash.
Kilkukrotnie szybsze odpowiedzi modelu, bez utraty jakości i niższym kosztem – to oznacza, że „lokalnie znaczy wolniej" przestaje być prawdą. Nie do wszystkiego potrzebujesz modelu klasy Opus – przy klasyfikacji, generowaniu opisów czy masowym przetwarzaniu po polsku lokalny model wystarcza.
E-commerce dzieli dane na dwie kategorie. Katalog produktów – chmura wystarczy. Marże, dane klientów – wiele firm i tak nie wypuści. Nie z powodu zagrożenia, lecz wewnętrznych zasad i wymogów kontraktowych. Skoro lokalny model przestaje być wolniejszy tam, gdzie i tak był wystarczający, podział chmura/lokalnie przestaje być kompromisem. Staje się świadomą decyzją: ciężka analityka do modelu frontier, masowe przetwarzanie wrażliwych danych u siebie. I wygra ten, kto rozrysuje tę granicę celowo – zanim wymusi to regulator albo klient.