ai:integrace:cli:firecrawl

Firecrawl

Vytvořeno: 15.8.2026 | Aktualizováno: 15.08.2026 12:51

Firecrawl je služba a open-source projekt pro vyhledávání, stahování a zpracování obsahu webu pro AI agenty. Z URL nebo celého webu vrací obsah jako Markdown, HTML, screenshot nebo strukturovaná data; je určený hlavně pro rešerši, RAG a hromadné získávání webového obsahu.

Firecrawl sjednocuje několik kroků, které by jinak bylo potřeba řešit samostatně: vyhledání zdrojů, vykreslení stránek s JavaScriptem, extrakci hlavního obsahu a převod na výstup vhodný pro LLM. Dokumentace Firecrawl popisuje funkce pro vyhledávání, načtení jedné URL, mapování odkazů a crawl celého webu.

Hodí se zejména pro:

  • přípravu podkladů z více aktuálních webových zdrojů;
  • stažení dokumentace pro RAG nebo lokální knowledge base;
  • hromadné získání obsahu konkrétního webu;
  • extrakci dat do předem určené JSON struktury.
Potřeba Vhodnější nástroj Důvod
Stáhnout známou statickou URL curl Je rychlý, lokální a bez další služby.
Přihlásit se, kliknout do aplikace nebo ladit DOM a síťové požadavky Playwright Nabízí přesné řízení prohlížeče a lepší debugging.
Získat odpověď na obecnou otázku z více zdrojů Perplexity přes mcpc Jde o rešeršní a syntetizační službu se zdroji, ne o export obsahu vybraného webu.
Projít web, získat čistý text a předat jej dalšímu LLM workflow Firecrawl Řeší získání a normalizaci webového obsahu jako data.

Playwright a Firecrawl se částečně překrývají: oba mohou pracovat s dynamickým webem. Playwright je nástroj pro řízení konkrétní browserové relace. Firecrawl je vyšší vrstva, která má vrátit webový obsah nebo data bez nutnosti psát vlastní crawler, extraktor a převod HTML na Markdown.

Pro ad-hoc technickou rešerši je vhodné nejdřív použít Perplexity. Firecrawl má přidanou hodnotu až tehdy, když je potřeba získat úplný obsah konkrétního webu nebo většího souboru známých URL pro další automatizované zpracování.

Příklady:

  • „Najdi odpověď a porovnej několik zdrojů.“ → Perplexity.
  • „Stáhni celou dokumentaci tohoto projektu do Markdownu pro RAG.“ → Firecrawl.
  • „Přihlas se do administrace a stáhni fakturu.“ → Playwright.

Firecrawl poskytuje CLI, API i MCP rozhraní. MCP je jen způsob připojení; tento článek je zařazený mezi CLI integrace, protože hlavní téma je napojení agenta na webovou datovou službu, ne samotný MCP protokol.

Firecrawl lze provozovat lokálně. Dokumentace self-hostingu uvádí Compose stack s API, workery, Playwrightem, Redisem, RabbitMQ a PostgreSQL frontou; FoundationDB je součástí volitelného backendu fronty.

Self-hosting dává kontrolu nad zpracováním URL a obsahu, ale nepřenáší provozní odpovědnost na projekt: je potřeba zajistit autentizaci, TLS, perzistenci, zálohy, monitoring a aktualizace. Požadavky na cílové weby navíc půjdou z vlastní infrastruktury; cloudové proxy nebo ochrany proti blokování nejsou automatickým přínosem lokální instalace.

Firecrawl není nutný pro běžné použití tohoto agentního prostředí: rešerši pokrývá Perplexity, cílenou browserovou práci Playwright a jednoduché stažení curl. Má smysl jej přidat při konkrétní potřebě hromadného nebo opakovaného získávání čistého obsahu z webu.

  • ai/integrace/cli/firecrawl.txt
  • Poslední úprava: 15.08.2026 12:51
  • autor: Petr Nosek