Obsah

Firecrawl

Vytvořeno: 15.8.2026 | Aktualizováno: 15.08.2026 12:51

Firecrawl je služba a open-source projekt pro vyhledávání, stahování a zpracování obsahu webu pro AI agenty. Z URL nebo celého webu vrací obsah jako Markdown, HTML, screenshot nebo strukturovaná data; je určený hlavně pro rešerši, RAG a hromadné získávání webového obsahu.

K čemu slouží

Firecrawl sjednocuje několik kroků, které by jinak bylo potřeba řešit samostatně: vyhledání zdrojů, vykreslení stránek s JavaScriptem, extrakci hlavního obsahu a převod na výstup vhodný pro LLM. Dokumentace Firecrawl popisuje funkce pro vyhledávání, načtení jedné URL, mapování odkazů a crawl celého webu.

Hodí se zejména pro:

Kdy použít jiný nástroj

Potřeba Vhodnější nástroj Důvod
Stáhnout známou statickou URL curl Je rychlý, lokální a bez další služby.
Přihlásit se, kliknout do aplikace nebo ladit DOM a síťové požadavky Playwright Nabízí přesné řízení prohlížeče a lepší debugging.
Získat odpověď na obecnou otázku z více zdrojů Perplexity přes mcpc Jde o rešeršní a syntetizační službu se zdroji, ne o export obsahu vybraného webu.
Projít web, získat čistý text a předat jej dalšímu LLM workflow Firecrawl Řeší získání a normalizaci webového obsahu jako data.

Playwright a Firecrawl se částečně překrývají: oba mohou pracovat s dynamickým webem. Playwright je nástroj pro řízení konkrétní browserové relace. Firecrawl je vyšší vrstva, která má vrátit webový obsah nebo data bez nutnosti psát vlastní crawler, extraktor a převod HTML na Markdown.

Použití v agentním workflow

Pro ad-hoc technickou rešerši je vhodné nejdřív použít Perplexity. Firecrawl má přidanou hodnotu až tehdy, když je potřeba získat úplný obsah konkrétního webu nebo většího souboru známých URL pro další automatizované zpracování.

Příklady:

Firecrawl poskytuje CLI, API i MCP rozhraní. MCP je jen způsob připojení; tento článek je zařazený mezi CLI integrace, protože hlavní téma je napojení agenta na webovou datovou službu, ne samotný MCP protokol.

Self-hosting

Firecrawl lze provozovat lokálně. Dokumentace self-hostingu uvádí Compose stack s API, workery, Playwrightem, Redisem, RabbitMQ a PostgreSQL frontou; FoundationDB je součástí volitelného backendu fronty.

Self-hosting dává kontrolu nad zpracováním URL a obsahu, ale nepřenáší provozní odpovědnost na projekt: je potřeba zajistit autentizaci, TLS, perzistenci, zálohy, monitoring a aktualizace. Požadavky na cílové weby navíc půjdou z vlastní infrastruktury; cloudové proxy nebo ochrany proti blokování nejsou automatickým přínosem lokální instalace.

Rozhodnutí

Firecrawl není nutný pro běžné použití tohoto agentního prostředí: rešerši pokrývá Perplexity, cílenou browserovou práci Playwright a jednoduché stažení curl. Má smysl jej přidat při konkrétní potřebě hromadného nebo opakovaného získávání čistého obsahu z webu.

Zdroje