Unsloth
Vytvořeno: 18.8.2026 | Aktualizováno: 18.08.2026 13:58
Unsloth je open-source platforma pro lokální provoz, trénování a export AI modelů. Spojuje Python knihovnu pro efektivnější fine-tuning s aplikací Unsloth Studio/Desktop, ve které lze modely stahovat, zkoušet, připojovat k nástrojům a vystavovat přes API.
K čemu Unsloth slouží
Unsloth není další uzavřený jazykový model. Je to vrstva nad otevřenými modely, například z ekosystému Qwen, Gemma, Llama, DeepSeek nebo Mistral. Pomáhá je provozovat na vlastním hardwaru a podle potřeby je upravit pro konkrétní úlohu.
Hlavní použití:
- lokální chat a inference nad otevřeným modelem;
- fine-tuning modelu na vlastních datech;
- příprava a úprava datasetů;
- provoz modelu přes API kompatibilní s OpenAI;
- napojení lokálního modelu na coding agenty a MCP nástroje;
- export natrénovaného modelu či adaptéru pro další provoz.
Důvodem pro použití nemusí být jen cena API. Lokální běh se hodí také tehdy, když data nemají opouštět vlastní infrastrukturu, když je potřeba experimentovat s více modely nebo když je cílem vytvořit úzce zaměřený model pro opakovanou práci.
Části platformy
Unsloth Core
Unsloth Core je Pythonová knihovna a sada trénovacích postupů. Cílí zejména na snížení spotřeby VRAM a zrychlení trénování oproti běžnému použití knihoven Transformers a TRL. Projekt uvádí podporu LoRA, QLoRA, full fine-tuningu, pretrainigu a metod reinforcement learningu, například DPO a GRPO.
Nejčastější scénář je adaptace už hotového modelu pomocí LoRA nebo QLoRA. Neučí se celá váha modelu, ale menší adaptér. To snižuje nároky na GPU a usnadňuje ukládání i nasazení výsledku.
Unsloth Studio a Desktop
Unsloth Studio je webové rozhraní běžící lokálně; Desktop je jeho desktopová distribuce. Umožňuje vybrat a stáhnout model, založit chat, upravit systémový prompt, nastavit parametry inference, připojit MCP server, pracovat s datasety a spustit trénink bez nutnosti psát celý notebook od začátku.
Studio má smysl hlavně jako pracovní plocha pro experimentování s lokálními modely. Není nutné ho chápat jako náhradu za produkční multi-user agentní platformu: jeho silnou stránkou je model runtime a trénink, ne správa uživatelů, týmových rolí a izolovaných projektových prostředí.
Model runtime a API
Načtený model lze vystavit přes API Unslothu, které podporuje rozhraní kompatibilní s OpenAI a také endpoint ve stylu Anthropic Messages API. Existující aplikace pak mohou používat lokální model bez zásadní změny klientského kódu.
Tím se Unsloth může stát jednou částí širší architektury:
Aplikace nebo agent → OpenAI kompatibilní API Unslothu → lokální model
Nad modelem může být samostatné uživatelské rozhraní, RAG platforma nebo vlastní aplikace. Unsloth nemusí být nutně rozhraním, ve kterém koncový uživatel model ovládá.
Praktické scénáře
Lokální experimenty s modely
Studio je vhodné pro rychlé porovnání modelů a kvantizací na konkrétním hardwaru. Lze vyzkoušet, zda model rozumí češtině, jak pracuje s kontextem, zda spolehlivě volá nástroje nebo jak rychle odpovídá při zvolené kvantizaci.
Praktický výstup není jen odpověď z chatu. Výsledkem může být rozhodnutí, který model má smysl provozovat přes API pro konkrétní aplikaci.
Coding agent s lokálním modelem
Unsloth umí nastavit lokální model pro externí coding agenty. Po spuštění Studio a načtení modelu lze pro OpenCode použít:
unsloth start opencode
Tím se nemění OpenCode na webový systém pro správu agentů. Unsloth mu jen poskytne modelový backend. Je to užitečné například pro levné dílčí úlohy, klasifikaci souborů, základní analýzu repozitáře nebo opakované transformace dat. Pro komplexní plánování, dlouhé autonomní úlohy a spolehlivé používání nástrojů je nutné reálně otestovat kvalitu zvoleného modelu.
Unsloth Start podporuje také Claude Code, Codex, Hermes Agent a OpenClaw.
Fine-tuning interního asistenta
Pokud má asistent opakovaně dodržovat stejný formát, terminologii nebo klasifikaci, lze připravit trénovací data a vytvořit LoRA adaptér nad vhodným otevřeným modelem. Příkladem může být asistent, který:
- převádí technické zápisky do jednotné šablony;
- klasifikuje interní požadavky;
- vytváří odpovědi v definovaném stylu;
- rozpoznává specifickou oborovou terminologii.
Fine-tuning není správné řešení pro znalosti, které se často mění. Pro aktuální dokumentaci, ceníky nebo stav systémů bývá vhodnější RAG či nástroj, který data načte při odpovědi. Trénink také nezaručí věcnou správnost: kvalita výsledku přímo závisí na kvalitě, rozsahu a vyhodnocení trénovacích dat.
RAG, dokumenty a datasety
Studio obsahuje Data Recipes pro přípravu datasetů z dokumentů, například PDF, CSV a DOCX. Vedle trénování lze lokální model používat s RAG a nad dokumenty vyhledávat relevantní části.
Je potřeba oddělovat dvě věci:
- RAG dohledá aktuální podklady až při dotazu;
- fine-tuning upravuje chování modelu a jeho naučené vzory.
Tyto přístupy se doplňují. Například model může být fine-tunovaný na interní styl odpovědi, ale odpověď opírat o aktuální dokumenty získané přes RAG.
Podporované modely a hardware
Unsloth pracuje s textovými, vision, embeddingovými, audio/TTS i difuzními modely. Aktuální kompatibilitu je vhodné ověřovat v katalogu modelů, protože se rychle mění.
Pro inference lze podle typu modelu a kvantizace použít CPU nebo GPU. Praktická rychlost pro chat a velikost použitelného kontextu však obvykle vyžadují dostatek RAM a zejména VRAM. Pro trénink je GPU podstatně důležitější než pro jednoduché testování chatu.
Projekt uvádí podporu NVIDIA, Apple Silicon/MLX, AMD a vybraných scénářů s Vulkanem. Vulkan je určený pro GGUF inference; sám o sobě nenahrazuje backend potřebný pro plnohodnotný PyTorch nebo MLX trénink. Před výběrem modelu je proto nutné vycházet z konkrétní GPU, její VRAM a zamýšleného použití.
Export a nasazení
Výstupem nemusí zůstat jen model ve Studiu. Unsloth podporuje export například do formátů GGUF, safetensors, FP8 a dalších variant podle cílového runtime. GGUF je praktický pro provoz v nástrojích založených na llama.cpp a pro kvantizované modely na spotřebním hardwaru.
Před nasazením má smysl otestovat alespoň:
- kvalitu odpovědí na reprezentativních dotazech;
- spotřebu VRAM a RAM;
- rychlost prvního tokenu a generování;
- délku použitelného kontextu;
- spolehlivost structured output a tool callingu;
- chování při chybě nástroje nebo nedostupnosti modelu.
Bezpečnost a provoz
Ve výchozím stavu Studio běží lokálně. Při vystavení na LAN nebo přes veřejný HTTPS tunel se mění bezpečnostní model: kdokoli s přístupem a API klíčem může model používat. Zvláštní opatrnost je nutná u nástrojů pro shell, Python a webové vyhledávání, protože jejich serverová část může běžet pod uživatelem, který Studio spustil.
Pro vzdálený provoz je potřeba:
- nepouštět Studio pod účtem s nadbytečnými oprávněními;
- chránit API klíče a pravidelně je měnit;
- nevystavovat raw port do nedůvěryhodné sítě;
- nástroje vypnout, pokud je nepotřebuje vzdálený uživatel;
- pro týmové použití řešit autentizaci, autorizaci a oddělení projektů ve vrstvě určené pro multi-user provoz.
Návod k bezpečnému vzdálenému přístupu doporučuje pro publikování HTTPS tunel; i ten ale není náhradou za správu uživatelů a oprávnění.
Vztah k OpenCode a Open WebUI
Unsloth, OpenCode a Open WebUI řeší odlišné vrstvy:
- Unsloth provozuje a trénuje modely.
- OpenCode je coding agent pracující nad konkrétním projektem a systémovými nástroji.
- Open WebUI je webová vrstva pro uživatele, modelové presety, znalostní báze, nástroje a týmová oprávnění.
Pro osobní použití může být Unsloth Studio hlavním rozhraním pro lokální model. Ve firmě dává větší smysl použít Unsloth jako modelový backend a webové UI, identitu uživatelů, oprávnění a izolované execution prostředí řešit samostatně.
Licence
Projekt používá dvojí licencování. Jádro Unslothu je pod Apache 2.0, zatímco některé volitelné části včetně UI Unsloth Studio jsou pod AGPL-3.0. Před úpravou nebo provozem jako síťové služby je vhodné ověřit aktuální licenční podmínky konkrétních používaných komponent.