Modele AI FishRadar — Trening YOLO11 i Fine-Tuning LLM
Dwa wytrenowane i zoptymalizowane modele sztucznej inteligencji: sieć wizyjna YOLO11 ONNX działająca lokalnie na smartfonie oraz domenowy asystent LLM (Bielik-11B-v3.0-Instruct LoRA 126MB / Phi-3 GGUF 2.2GB na CPU).
Kontekst biznesowy
Identyfikacja gatunków ryb i asystent regulaminów wędkarskich muszą działać w terenie bez wysyłania zdjęć do kosztownych chmur zewnętrznych.
Problem technologiczny
Chmurowe API (Vision LLM) są zbyt wolne przy słabym zasięgu i generują wysokie koszty per zapytanie.
Rozwiązanie
Autorski trening sieci wizyjnej na wyczyszczonym datasecie oraz fine-tuning polskiego modelu Bielik-11B-v3.0-Instruct (SpeakLeash) techniką QLoRA z kwantyzacją wag do GGUF (Phi-3).
Kluczowe decyzje inżynierskie
DETAL INŻYNIERSKIRozdzielenie zadania: szybka detekcja wizyjna na krawędzi urządzenia (edge) i precyzyjne wnioskowanie tekstowe na CPU.
Trudne problemy i kompromisy
DETAL INŻYNIERSKIEliminacja fałszywych detekcji przy zmiennym oświetleniu i mokrych okazach.
Rezultat produkcyjny
Model wizyjny 38 klas działający w czasie rzeczywistym oraz asystent lokalny osiągający 35-45 tok/s na zwykłym CPU (strata treningowa 0.2494, 8/8 testów regresyjnych).
Jak to jest zbudowane
PyTorch -> eksport do ONNX dla klasyfikacji wizyjnej + Unsloth/QLoRA do fine-tuningu wag polskich (Bielik-11B-v3.0-Instruct) z kwantyzacją llama.cpp.
Masz wdrożenie o podobnej złożoności?
Rozmawiasz bezpośrednio z osobą, która zaprojektowała i wdrożyła ten system.