Vytvořeno: 15.8.2026 | Aktualizováno: 15.08.2026 12:51
Firecrawl je služba a open-source projekt pro vyhledávání, stahování a zpracování obsahu webu pro AI agenty. Z URL nebo celého webu vrací obsah jako Markdown, HTML, screenshot nebo strukturovaná data; je určený hlavně pro rešerši, RAG a hromadné získávání webového obsahu.
Firecrawl sjednocuje několik kroků, které by jinak bylo potřeba řešit samostatně: vyhledání zdrojů, vykreslení stránek s JavaScriptem, extrakci hlavního obsahu a převod na výstup vhodný pro LLM. Dokumentace Firecrawl popisuje funkce pro vyhledávání, načtení jedné URL, mapování odkazů a crawl celého webu.
Hodí se zejména pro:
| Potřeba | Vhodnější nástroj | Důvod |
|---|---|---|
| Stáhnout známou statickou URL | curl | Je rychlý, lokální a bez další služby. |
| Přihlásit se, kliknout do aplikace nebo ladit DOM a síťové požadavky | Playwright | Nabízí přesné řízení prohlížeče a lepší debugging. |
| Získat odpověď na obecnou otázku z více zdrojů | Perplexity přes mcpc | Jde o rešeršní a syntetizační službu se zdroji, ne o export obsahu vybraného webu. |
| Projít web, získat čistý text a předat jej dalšímu LLM workflow | Firecrawl | Řeší získání a normalizaci webového obsahu jako data. |
Playwright a Firecrawl se částečně překrývají: oba mohou pracovat s dynamickým webem. Playwright je nástroj pro řízení konkrétní browserové relace. Firecrawl je vyšší vrstva, která má vrátit webový obsah nebo data bez nutnosti psát vlastní crawler, extraktor a převod HTML na Markdown.
Pro ad-hoc technickou rešerši je vhodné nejdřív použít Perplexity. Firecrawl má přidanou hodnotu až tehdy, když je potřeba získat úplný obsah konkrétního webu nebo většího souboru známých URL pro další automatizované zpracování.
Příklady:
Firecrawl poskytuje CLI, API i MCP rozhraní. MCP je jen způsob připojení; tento článek je zařazený mezi CLI integrace, protože hlavní téma je napojení agenta na webovou datovou službu, ne samotný MCP protokol.
Firecrawl lze provozovat lokálně. Dokumentace self-hostingu uvádí Compose stack s API, workery, Playwrightem, Redisem, RabbitMQ a PostgreSQL frontou; FoundationDB je součástí volitelného backendu fronty.
Self-hosting dává kontrolu nad zpracováním URL a obsahu, ale nepřenáší provozní odpovědnost na projekt: je potřeba zajistit autentizaci, TLS, perzistenci, zálohy, monitoring a aktualizace. Požadavky na cílové weby navíc půjdou z vlastní infrastruktury; cloudové proxy nebo ochrany proti blokování nejsou automatickým přínosem lokální instalace.
Firecrawl není nutný pro běžné použití tohoto agentního prostředí: rešerši pokrývá Perplexity, cílenou browserovou práci Playwright a jednoduché stažení curl. Má smysl jej přidat při konkrétní potřebě hromadného nebo opakovaného získávání čistého obsahu z webu.