Vytvořeno: 25.8.2026 | Aktualizováno: 25.08.2026 15:59
LongHorizon-Harness je open-source harness pro dlouhé agentní úlohy. Nestaví nový model ani nenahrazuje Claude Code nebo Codex; obaluje je řídicí smyčkou, která rozděluje práci na malé kroky, uchovává jen ověřený stav a nenechá agenta hodnotit vlastní práci bez nezávislé kontroly.
Agent při dlouhé práci naráží hlavně na tři problémy: roste mu historie, hromadí se chyby a ztrácí přehled o skutečném stavu projektu.
Základ frameworku popisuje článek LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks. Práce není jedna dlouhá relace, ale opakování tří rolí:
Jen závěr Auditora může změnit trvalý stav úlohy. Pokud audit neprojde, Manager vidí důkazy o selhání a připraví opravu nebo jiný další krok. Hrubá historie práce Executora se po kole nezachovává; mezi koly zůstává kompaktní stav a auditní reporty.
Příklad: místo zadání „vytvoř celou aplikaci“ Manager připraví krok „přidej přihlášení s e-mailovým heslem; test musí ověřit úspěšné přihlášení i odmítnutí špatného hesla“. Executor jej implementuje. Auditor pak nespokojí s tvrzením „hotovo“, ale spustí testy a podle potřeby provede end-to-end kontrolu v prohlížeči.
Následující tabulka porovnává běžný Claude Code a LongHorizon-Harness se stejným backbone tam, kde to autoři měřili přímo. PassRate znamená podíl zcela splněných úloh, Binary vyžaduje finální skóre 1 a Partial je průměrné dílčí skóre.
| Benchmark | Model a backend | Claude Code bez LHH | LongHorizon-Harness |
|---|---|---|---|
| WeaveBench (114 GUI+CLI úloh) | Qwen 3.7-Plus, Claude Code | PassRate 51,8 %; Overall 0,702 | PassRate 80,7 %; Overall 0,835 |
| OSWorld 2.0 (108 desktopových úloh) | Qwen 3.7-Plus | Binary 2,8 %; Partial 21,5 % | Binary 8,3 %; Partial 35,2 % |
| Terminal-Bench 2.1 | Qwen 3.7-Plus, Claude Code | Success rate 69,7 % | Success rate 77,2 % |
| OSWorld 2.0, podmnožina 34 úloh | Claude Opus 4.7 | Binary 20,6 %; Partial 55,8 % | Binary 35,3 %; Partial 66,9 % |
Nejvýraznější je trojnásobný nárůst binárního dokončení na OSWorld 2.0: 2,8 % na 8,3 %. Znamená to ale jen to, že úloha splnila všechna benchmarková kritéria; neznamená to trojnásobnou obecnou schopnost modelu.
Autoři uvádějí i prakticky důležitou cenu za vyšší spolehlivost:
Závěr není „tři role vždy stojí trojnásobek“. Náklady závisí na úloze, schopnosti Executora a počtu kol nutných pro opravy.
Paper obsahuje konkrétní trajektorie, které video používá jako názorné příklady. Jde o skóre jednotlivých benchmarkových úloh, ne o obecnou míru úspěšnosti frameworku.
Toto je hlavní hodnota frameworku: neudělá model lepším v matematice, vidění nebo algoritmizaci. Může ale zabránit tomu, aby už ověřený pokrok zanikl v dlouhé historii nebo aby vizuálně věrohodný výsledek prošel bez kontroly postupu.
Ve videu Nechal jsem AI 3 dny bez dozoru. Tohle postavila. Marek Bartoš vysvětluje princip na vlastním projektu Skippy Workouts.
Je potřeba oddělit čísla z osobní demonstrace od benchmarků v paperu. Následující hodnoty jsou tvrzení autora videa, nikoli nezávisle replikovaný benchmark:
Video také správně upozorňuje, že běžný agent může opakovat neúspěšný krok velmi dlouho: v ukázce Wiresharku šlo o více než 400 kroků. Důležitější než vytrvalost je proto schopnost převést selhání do ověřeného stavu, na který další krok skutečně reaguje.
Video mluví o maximálně 40 iteracích. Tuto hodnotu nelze bez kontextu brát jako aktuální výchozí nastavení. Paper použil pro své experimenty maximum 25 kol. Ve zdrojovém kódu verze 0.1.7 je výchozí hodnota také 25, zatímco README v témže repozitáři uvádí 30. Jde tedy o nekonzistenci dokumentace nebo o změnu mezi konfiguracemi.
Pro vlastní běh je bezpečnější nastavit limit explicitně, například:
lh-harness run --task @task.md --agent claude_code --max-rounds 5 --no-dashboard
Claude Code už umí plánovat, pracovat s nástroji a udržovat kontext. LongHorizon-Harness nad něj přidává hlavně:
To odpovídá principům z článku Effective harnesses for long-running agents: postupovat po malých ověřitelných funkcích, používat Git a průběžný záznam práce, po každé relaci ponechat projekt v čistém stavu a neoznačovat položku za hotovou bez end-to-end ověření.
Pro CLI workflow je potřeba Python 3.10+ a alespoň jeden agentní runtime v cestě, například `claude`, `codex` nebo `opencode`. Pro ovládání desktopových aplikací je navíc nutný podporovaný computer-use plugin a oprávnění operačního systému.
Nejbezpečnější je začít v samostatném Git repozitáři, ne v produkčním projektu:
# Nejprve se přihlásit do Claude Code, pokud se má použít předplatné claude # Instalace harnessu uv tool install lh-harness # V adresáři testovacího projektu lh-harness init lh-harness doctor # Krátký první běh bez dashboardu lh-harness run --task @task.md --agent claude_code --max-rounds 5 --no-dashboard
Soubor `task.md` by měl obsahovat konkrétní cíl, omezení a ověřitelné Definition of Done. Příkaz `lh-harness run` standardně pracuje v aktuálním adresáři, proto je izolovaný workspace důležitý.
API klíč není pro Claude Code povinný. Volba pro předání API klíče je v LongHorizon-Harness volitelná; pokud ji nepředáš, adapter spustí CLI `claude` a použije jeho existující přihlášení. Pro lokální použití s aktivním předplatným Claude Code tedy stačí se nejdřív přihlásit přes `claude`.
API klíč je vhodný nebo nutný, pokud:
Předplatné Claude Code nepokrývá volání modelů jiných poskytovatelů. Také je potřeba počítat s tím, že Manager, Executor a Auditor znamenají opakované samostatné invokace modelu. Dlouhý běh proto může narazit na usage limity předplatného dříve než běžná interaktivní práce v Claude Code.
Executor má měnit skutečné prostředí. Claude Code adapter ve frameworku spouští Claude v režimu přeskočení potvrzování oprávnění; omezení rolí se realizuje hlavně seznamem zakázaných nástrojů. Nejde o bezpečnostní sandbox.
Nespouštět první úlohy proti produkci, na hostiteli s citlivými přístupy nebo v hlavní větvi důležitého repozitáře. Vhodný postup je samostatný workspace, omezený počet kol, Git commit před během, testovací data a průběžná kontrola dashboardu či auditních reportů.