Tokenizer i dane
Własny tokenizer BPE, pipeline czyszczenia, podział danych oraz raport jakości.
Fabryka AI · LLM od zera · edycja 2 · pre-sale
12 tygodni budowania własnego polskiego modelu: od tokenizera, przez trening i ewaluację, po działające API. To kameralna grupa z bezpośrednim kontaktem do prowadzących — seminarium, nie masowy kurs. 15 miejsc w pre-sale po 1 900 zł. Z tych wpłat kupujemy NVIDIA DGX Spark: 128 GB pamięci pod trening, inferencję i ewaluacje. Po programie Spark zostaje w laboratorium Slayer — do dalszych badań i dla ciekawych projektów, wedle uznania prowadzącego.
0z 15 miejsc zarezerwowanych
15 × 1 900 zł = 28 500 zł. DGX Spark 128 GB / 4 TB kosztuje u polskiego dystrybutora 25 699 zł (superstorage.pl, 10.09.2026). Reszta idzie na prąd i dysk. Licznik rośnie po zaksięgowaniu wpłaty.
01 · edycja 1 → 2
Pierwsze 14 miejsc poszło do znajomych i alumnów w kilka godzin. To był dowód, że program ma sens, a nie cena rynkowa. Edycja 2 jest większa i widać to w konkretach, nie w przymiotnikach.
128 GB zunifikowanej pamięci na trening, inferencję i ewaluacje kohorty. Każdy dostaje przydział czasu w harmonogramie, większe joby idą w soboty, a obecny RTX 3090 pracuje jako druga maszyna. Po programie Spark zostaje w laboratorium Slayer — do dalszych badań i ciekawych projektów, wedle uznania prowadzącego.
Twoje repo czyta ktoś, kto trzy miesiące temu przeszedł tę samą drogę i pamięta, gdzie się wywraca loss.
Bezpośredni kontakt z prowadzącymi, nie wykład dla tłumu. Wielkość grupy dopasowujemy do zapisów — bliżej seminarium niż masowego szkolenia.
Długie sesje na trening i debugowanie, nie tylko wieczory po pracy. Wtedy uruchamiamy większe eksperymenty na Sparku.
Edycja 1 skończyła się wspólnym artykułem. Edycja 2 celuje w to samo, tym razem z ewaluacjami policzonymi na własnym sprzęcie.
Dowody z edycji 1 · kliknij
DanePolish DynaWord9,64 mld tokenów · 18 źródeł · Hugging Face ↗ ModeleSlayerLab na Hugging FaceGoLLeM-110M-PL, slayer-scratch, tokenizery BPE 32k/65k ↗ RepoGPT + tokenizer od zeracheckpoint 136M, skrypty treningowe, dokumentacja odtworzenia ↗Kto prowadzi
Kacper WikiełBuduje dane pretreningowe, tokenizery i pipeline'y ewaluacji dla polskich i niskozasobowych modeli w SlayerLab (Fabryka AI). Wcześniej ML Engineer w PwC, ML/CV Engineer u krajowego operatora infrastruktury przesyłowej i Software Engineer od generatywnego AI w Procter & Gamble. Autor Polish DynaWord, CodeSOTA i Hardparse. O polskich modelach mówił w TVN24.
Polski wariant frameworku Dynaword (Enevoldsen i in., 2025): każde źródło ma osobny datasheet i jawnie wykluczone kandydatury, a nie sam zrzut bajtów. Artykuł zespołu jest wciąż szkicem — celujemy w zamknięcie go do końca września 2026.
02 · sprzęt
NVIDIA DGX Spark to komputer wielkości książki z układem GB10 Grace Blackwell. Dużo pamięci, umiarkowana przepustowość: 128 GB mieści modele, których 3090 nie udźwignie, ale nie jest dwa razy szybszy. Dlatego Spark pracuje na harmonogramie, a 3090 zostaje jako druga maszyna.
# NVIDIA DGX Spark · GB10 Grace Blackwell
memory = 128 GB unified LPDDR5X · 273 GB/s
compute = 1 PFLOP FP4 · 20 rdzeni Arm · 240 W
storage = 4 TB NVMe · ConnectX-7 200 GbE
inference: modele do 200B parametrów (FP4)
fine-tuning: do 70B (QLoRA) · pretraining: małe modele kursu
# harmonogram: sloty w tygodniu · duże joby w soboty
# po programie: 12 mies. dla labu Slayer i fundatorów
03 · rezultat
Program prowadzi przez cały łańcuch pracy. Rezultatem nie jest certyfikat, lecz kod, decyzje, pomiary i model, który potrafisz wyjaśnić.
Własny tokenizer BPE, pipeline czyszczenia, podział danych oraz raport jakości.
Mały GPT napisany i wytrenowany od podstaw, z manifestem konfiguracji i checkpointami.
Held-out loss, próbki generacji i mini-benchmark z opisanym protokołem oraz ograniczeniami.
Dostrojenie, kwantyzacja i lokalne API z pomiarem szybkości oraz kosztu inferencji.
04 · program
Każdy tydzień rozwija ten sam projekt. Kliknij moduł, aby zobaczyć temat i artefakt końcowy.
Byte-level BPE, kompresja i pułapki polskiej morfologii.
Artefakt: własny tokenizer i raport porównawczy.Źródła, licencje, filtrowanie jakości, MinHash/LSH, PII i deterministyczne splity.
Artefakt: pipeline danych z manifestem pochodzenia.Od zliczeń do sieci, embeddingi, backprop i negative log likelihood.
Artefakt: bigram i MLP generujące pierwsze próbki.Self-attention krok po kroku, maska przyczynowa, multi-head i pozycje.
Artefakt: single-head attention bez gotowego modułu.Bloki transformera, pre-norm, RMSNorm, SwiGLU, GQA i świadome decyzje architektoniczne.
Artefakt: model robiący pełny forward pass.Batching, AdamW, harmonogram LR, mixed precision, checkpointing i diagnostyka lossa. Pierwszy dłuższy run na Sparku.
Artefakt: wytrenowany checkpoint i karta przebiegu.Scaling laws, budżet tokenów, multi-GPU i ekonomia treningu.
Artefakt: policzony plan większego eksperymentu.Held-out loss, zadania downstream, benchmarki polskie i ryzyko kontaminacji. Modele-sędziowie uruchamiane lokalnie na Sparku.
Artefakt: własny mały benchmark z kartą metodologiczną.Dane instrukcyjne, chat templates i adaptacja niskiego rzędu.
Artefakt: porównanie modelu przed i po dostrojeniu.Dane preferencyjne, funkcja celu DPO i typowe błędy alignowania małych modeli.
Artefakt: kontrolowany eksperyment DPO.KV-cache, batching, kwantyzacja, llama.cpp i pomiar tokenów na sekundę.
Artefakt: lokalne API z benchmarkiem wydajności.Projekt end-to-end: dane, trening lub dostrojenie, ewaluacja i wdrożenie. Wspólny artykuł kohorty.
Artefakt: publiczne demo na Sparku i dokumentacja decyzji.05 · metoda
Nie obiecujemy wyniku bez pomiaru. Ustalamy rytm, kryteria artefaktu i sposób review, a postęp jest widoczny w kodzie.
Zajęcia porządkują temat, sobota warsztatowa uruchamia większy eksperyment, a zadanie kończy się sprawdzalnym plikiem, kodem lub wynikiem.
Liczy się nie tylko to, czy kod działa. Opisujesz założenia, porównujesz warianty i bronisz wniosków na podstawie pomiaru. Czyta TA z edycji 1 i Kacper.
Źródła danych, konfiguracje, checkpointy, metryki i ograniczenia pozostają w repo. Da się odtworzyć drogę do wyniku.
06 · cena
Cena rośnie, bo produkt urósł: sprzęt w cenie, TA, kameralna grupa, soboty. Pre-sale jest tańszy, bo płacisz zanim Spark stoi na biurku i to twoja wpłata go kupuje. To seminarium z bezpośrednim kontaktem do prowadzących, nie masowy kurs — wielkość grupy po pre-sale ustalamy wedle zapisów. Ceny są końcowe, faktura na firmę na życzenie.
700 zł
1 900 zł
2 900 zł
W cenie każdego miejsca w edycji 2: 12 tygodni zajęć w kameralnej grupie, soboty warsztatowe, przydział czasu na Sparku przez cały program, review TA i Kacpra, nagrania, Discord kohorty, faktura na firmę na życzenie.
Jeśli do 30.09.2026 nie zbierze się 15 wpłat, wybierasz: zwrot 100% albo miejsce w edycji na obecnym sprzęcie. Po starcie masz 14 dni na rezygnację bez pytań. Jeden mail wystarczy.
07 · rezerwacja
Zostaw imię, e-mail i telefon. Kacper dzwoni albo pisze z linkiem do płatności (EasyTools) — telefon jest obowiązkowy, żeby nic nie zginęło w mailu. Miejsce trzymam trzy dni robocze na wpłatę, potem wraca do puli.
08 · dla kogo
09 · ekosystem
LLM od zera jest ścieżką edukacyjną Fabryka AI. Po kursie mapa się nie kończy: Spark zostaje w Slayerze, absolwenci wracają jako TA, a ewaluacje trafiają do CodeSOTA.
Buduje polskie produkty, infrastrukturę i badania AI.
fabryka.ai ↗ 02 · laboratoriumSlayerOtwarte laboratorium modeli, danych i eksperymentów. Tu zamieszka Spark.
slayer.fabryka.ai ↗ 03 · pomiarCodeSOTAŹródła, protokoły i rygor oceny wyników.
codesota.com ↗ 04 · warsztatDiscordCodzienna rozmowa, pytania i współpraca społeczności.
dołącz ↗10 · FAQ
Bo miejsce rezerwujemy ręcznie i płacisz linkiem EasyTools, nie przelewem na dane ze strony. Telefon jest jedynym pewnym sposobem, żeby link do płatności do Ciebie dotarł i nie utknął w spamie.
Bo 700 zł było ceną dla pierwszych 14 osób, znajomych i alumnów, i miało sprawdzić, czy program działa. Zadziałał: miejsca zniknęły w kilka godzin, a edycja skończyła się artykułem. Edycja 2 ma w cenie sprzęt, TA, kameralną grupę i soboty. Regular będzie kosztował 2 900 zł.
Wybierasz: pełny zwrot albo miejsce w edycji prowadzonej na obecnym sprzęcie (RTX 3090 plus chmura na godziny). Nie kupujemy Sparka na kredyt i nie podnosimy ceny w trakcie.
Listopad 2026. Dokładny termin potwierdzam mailem do wszystkich fundatorów po zamknięciu pre-sale, żeby Spark był na miejscu przed pierwszymi zajęciami.
Nie. Laptop do pisania kodu i przydział czasu na Sparku wystarczą na cały program. Mniejsze eksperymenty puścisz lokalnie na CPU, większe na Sparku w swoim slocie albo w sobotę, a RTX 3090 laboratorium jest drugą maszyną.
Kameralna — to bliżej seminarium niż masowego kursu, każdy ma bezpośredni kontakt do prowadzących. Wielkość po pre-sale ustalamy wedle zapisów, bez z góry narzuconego planu na sztywną liczbę grup. Pre-sale finansuje Sparka, regular finansuje TA i prowadzenie.
Laboratorium Slayer. Po programie służy dalszym badaniom i ciekawym projektom — o dostępie, także dla fundatorów, decyduje prowadzący, bez z góry ustalonego okresu ani gwarancji. Nie trafia do niczyjego domu i nie idzie na sprzedaż.
Podstawy Pythona i gotowość do matematyki na poziomie licealnym. PyTorch i transformatory budujemy krok po kroku.
Zajęcia w tygodniu, sobota warsztatowa i regularna praca własna nad repo. Realny zakres godzin potwierdzam przy rozmowie, zależnie od punktu startowego.
Tak, na firmę. 1 900 zł to cena końcowa. Po rezerwacji odpisz na maila z NIP-em, a fakturę dostaniesz przez EasyTools razem z linkiem do płatności.
Repo projektu, tokenizer, konfiguracje, checkpointy, wyniki ewaluacji, dokumentacja decyzji, działające demo na Sparku i wspólny artykuł kohorty.