Firecrawl
Vytvořeno: 15.8.2026 | Aktualizováno: 15.08.2026 12:51
Firecrawl je služba a open-source projekt pro vyhledávání, stahování a zpracování obsahu webu pro AI agenty. Z URL nebo celého webu vrací obsah jako Markdown, HTML, screenshot nebo strukturovaná data; je určený hlavně pro rešerši, RAG a hromadné získávání webového obsahu.
K čemu slouží
Firecrawl sjednocuje několik kroků, které by jinak bylo potřeba řešit samostatně: vyhledání zdrojů, vykreslení stránek s JavaScriptem, extrakci hlavního obsahu a převod na výstup vhodný pro LLM. Dokumentace Firecrawl popisuje funkce pro vyhledávání, načtení jedné URL, mapování odkazů a crawl celého webu.
Hodí se zejména pro:
- přípravu podkladů z více aktuálních webových zdrojů;
- stažení dokumentace pro RAG nebo lokální knowledge base;
- hromadné získání obsahu konkrétního webu;
- extrakci dat do předem určené JSON struktury.
Kdy použít jiný nástroj
| Potřeba | Vhodnější nástroj | Důvod |
|---|---|---|
| Stáhnout známou statickou URL | curl | Je rychlý, lokální a bez další služby. |
| Přihlásit se, kliknout do aplikace nebo ladit DOM a síťové požadavky | Playwright | Nabízí přesné řízení prohlížeče a lepší debugging. |
| Získat odpověď na obecnou otázku z více zdrojů | Perplexity přes mcpc | Jde o rešeršní a syntetizační službu se zdroji, ne o export obsahu vybraného webu. |
| Projít web, získat čistý text a předat jej dalšímu LLM workflow | Firecrawl | Řeší získání a normalizaci webového obsahu jako data. |
Playwright a Firecrawl se částečně překrývají: oba mohou pracovat s dynamickým webem. Playwright je nástroj pro řízení konkrétní browserové relace. Firecrawl je vyšší vrstva, která má vrátit webový obsah nebo data bez nutnosti psát vlastní crawler, extraktor a převod HTML na Markdown.
Použití v agentním workflow
Pro ad-hoc technickou rešerši je vhodné nejdřív použít Perplexity. Firecrawl má přidanou hodnotu až tehdy, když je potřeba získat úplný obsah konkrétního webu nebo většího souboru známých URL pro další automatizované zpracování.
Příklady:
- „Najdi odpověď a porovnej několik zdrojů.“ → Perplexity.
- „Stáhni celou dokumentaci tohoto projektu do Markdownu pro RAG.“ → Firecrawl.
- „Přihlas se do administrace a stáhni fakturu.“ → Playwright.
Firecrawl poskytuje CLI, API i MCP rozhraní. MCP je jen způsob připojení; tento článek je zařazený mezi CLI integrace, protože hlavní téma je napojení agenta na webovou datovou službu, ne samotný MCP protokol.
Self-hosting
Firecrawl lze provozovat lokálně. Dokumentace self-hostingu uvádí Compose stack s API, workery, Playwrightem, Redisem, RabbitMQ a PostgreSQL frontou; FoundationDB je součástí volitelného backendu fronty.
Self-hosting dává kontrolu nad zpracováním URL a obsahu, ale nepřenáší provozní odpovědnost na projekt: je potřeba zajistit autentizaci, TLS, perzistenci, zálohy, monitoring a aktualizace. Požadavky na cílové weby navíc půjdou z vlastní infrastruktury; cloudové proxy nebo ochrany proti blokování nejsou automatickým přínosem lokální instalace.
Rozhodnutí
Firecrawl není nutný pro běžné použití tohoto agentního prostředí: rešerši pokrývá Perplexity, cílenou browserovou práci Playwright a jednoduché stažení curl. Má smysl jej přidat při konkrétní potřebě hromadného nebo opakovaného získávání čistého obsahu z webu.