Obsah

LongHorizon-Harness

Vytvořeno: 25.8.2026 | Aktualizováno: 25.08.2026 15:59

LongHorizon-Harness je open-source harness pro dlouhé agentní úlohy. Nestaví nový model ani nenahrazuje Claude Code nebo Codex; obaluje je řídicí smyčkou, která rozděluje práci na malé kroky, uchovává jen ověřený stav a nenechá agenta hodnotit vlastní práci bez nezávislé kontroly.

Proč je potřeba

Agent při dlouhé práci naráží hlavně na tři problémy: roste mu historie, hromadí se chyby a ztrácí přehled o skutečném stavu projektu.

Smyčka Manage–Execute–Audit

Základ frameworku popisuje článek LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks. Práce není jedna dlouhá relace, ale opakování tří rolí:

Jen závěr Auditora může změnit trvalý stav úlohy. Pokud audit neprojde, Manager vidí důkazy o selhání a připraví opravu nebo jiný další krok. Hrubá historie práce Executora se po kole nezachovává; mezi koly zůstává kompaktní stav a auditní reporty.

Příklad: místo zadání „vytvoř celou aplikaci“ Manager připraví krok „přidej přihlášení s e-mailovým heslem; test musí ověřit úspěšné přihlášení i odmítnutí špatného hesla“. Executor jej implementuje. Auditor pak nespokojí s tvrzením „hotovo“, ale spustí testy a podle potřeby provede end-to-end kontrolu v prohlížeči.

Metriky z paperu

Následující tabulka porovnává běžný Claude Code a LongHorizon-Harness se stejným backbone tam, kde to autoři měřili přímo. PassRate znamená podíl zcela splněných úloh, Binary vyžaduje finální skóre 1 a Partial je průměrné dílčí skóre.

Benchmark Model a backend Claude Code bez LHH LongHorizon-Harness
WeaveBench (114 GUI+CLI úloh) Qwen 3.7-Plus, Claude Code PassRate 51,8 %; Overall 0,702 PassRate 80,7 %; Overall 0,835
OSWorld 2.0 (108 desktopových úloh) Qwen 3.7-Plus Binary 2,8 %; Partial 21,5 % Binary 8,3 %; Partial 35,2 %
Terminal-Bench 2.1 Qwen 3.7-Plus, Claude Code Success rate 69,7 % Success rate 77,2 %
OSWorld 2.0, podmnožina 34 úloh Claude Opus 4.7 Binary 20,6 %; Partial 55,8 % Binary 35,3 %; Partial 66,9 %

Nejvýraznější je trojnásobný nárůst binárního dokončení na OSWorld 2.0: 2,8 % na 8,3 %. Znamená to ale jen to, že úloha splnila všechna benchmarková kritéria; neznamená to trojnásobnou obecnou schopnost modelu.

Autoři uvádějí i prakticky důležitou cenu za vyšší spolehlivost:

Závěr není „tři role vždy stojí trojnásobek“. Náklady závisí na úloze, schopnosti Executora a počtu kol nutných pro opravy.

Případové studie: proč nestačí výsledek, který vypadá dobře

Paper obsahuje konkrétní trajektorie, které video používá jako názorné příklady. Jde o skóre jednotlivých benchmarkových úloh, ne o obecnou míru úspěšnosti frameworku.

Toto je hlavní hodnota frameworku: neudělá model lepším v matematice, vidění nebo algoritmizaci. Může ale zabránit tomu, aby už ověřený pokrok zanikl v dlouhé historii nebo aby vizuálně věrohodný výsledek prošel bez kontroly postupu.

Video: tři dny autonomního vývoje

Ve videu Nechal jsem AI 3 dny bez dozoru. Tohle postavila. Marek Bartoš vysvětluje princip na vlastním projektu Skippy Workouts.

Je potřeba oddělit čísla z osobní demonstrace od benchmarků v paperu. Následující hodnoty jsou tvrzení autora videa, nikoli nezávisle replikovaný benchmark:

Video také správně upozorňuje, že běžný agent může opakovat neúspěšný krok velmi dlouho: v ukázce Wiresharku šlo o více než 400 kroků. Důležitější než vytrvalost je proto schopnost převést selhání do ověřeného stavu, na který další krok skutečně reaguje.

Rozpor v počtu kol

Video mluví o maximálně 40 iteracích. Tuto hodnotu nelze bez kontextu brát jako aktuální výchozí nastavení. Paper použil pro své experimenty maximum 25 kol. Ve zdrojovém kódu verze 0.1.7 je výchozí hodnota také 25, zatímco README v témže repozitáři uvádí 30. Jde tedy o nekonzistenci dokumentace nebo o změnu mezi konfiguracemi.

Pro vlastní běh je bezpečnější nastavit limit explicitně, například:

lh-harness run --task @task.md --agent claude_code --max-rounds 5 --no-dashboard

Co framework přidává nad Claude Code

Claude Code už umí plánovat, pracovat s nástroji a udržovat kontext. LongHorizon-Harness nad něj přidává hlavně:

To odpovídá principům z článku Effective harnesses for long-running agents: postupovat po malých ověřitelných funkcích, používat Git a průběžný záznam práce, po každé relaci ponechat projekt v čistém stavu a neoznačovat položku za hotovou bez end-to-end ověření.

Instalace a první běh

Pro CLI workflow je potřeba Python 3.10+ a alespoň jeden agentní runtime v cestě, například `claude`, `codex` nebo `opencode`. Pro ovládání desktopových aplikací je navíc nutný podporovaný computer-use plugin a oprávnění operačního systému.

Nejbezpečnější je začít v samostatném Git repozitáři, ne v produkčním projektu:

# Nejprve se přihlásit do Claude Code, pokud se má použít předplatné
claude
 
# Instalace harnessu
uv tool install lh-harness
 
# V adresáři testovacího projektu
lh-harness init
lh-harness doctor
 
# Krátký první běh bez dashboardu
lh-harness run --task @task.md --agent claude_code --max-rounds 5 --no-dashboard

Soubor `task.md` by měl obsahovat konkrétní cíl, omezení a ověřitelné Definition of Done. Příkaz `lh-harness run` standardně pracuje v aktuálním adresáři, proto je izolovaný workspace důležitý.

Claude Code předplatné nebo API klíč

API klíč není pro Claude Code povinný. Volba pro předání API klíče je v LongHorizon-Harness volitelná; pokud ji nepředáš, adapter spustí CLI `claude` a použije jeho existující přihlášení. Pro lokální použití s aktivním předplatným Claude Code tedy stačí se nejdřív přihlásit přes `claude`.

API klíč je vhodný nebo nutný, pokud:

Předplatné Claude Code nepokrývá volání modelů jiných poskytovatelů. Také je potřeba počítat s tím, že Manager, Executor a Auditor znamenají opakované samostatné invokace modelu. Dlouhý běh proto může narazit na usage limity předplatného dříve než běžná interaktivní práce v Claude Code.

Bezpečnost a omezení

Executor má měnit skutečné prostředí. Claude Code adapter ve frameworku spouští Claude v režimu přeskočení potvrzování oprávnění; omezení rolí se realizuje hlavně seznamem zakázaných nástrojů. Nejde o bezpečnostní sandbox.

Nespouštět první úlohy proti produkci, na hostiteli s citlivými přístupy nebo v hlavní větvi důležitého repozitáře. Vhodný postup je samostatný workspace, omezený počet kol, Git commit před během, testovací data a průběžná kontrola dashboardu či auditních reportů.

Zdroje