ai:platformy:agenti-a-orchestrace:autoresearch

Rozdíly

Zde můžete vidět rozdíly mezi vybranou verzí a aktuální verzí dané stránky.

Odkaz na výstup diff

Následující verze
Předchozí verze
ai:platformy:agenti-a-orchestrace:autoresearch [11.04.2026 13:49] – Věrná migrace autoresearch do agentů a orchestrace Petr Nosekai:platformy:agenti-a-orchestrace:autoresearch [24.07.2026 07:27] (aktuální) Petr Nosek
Řádek 1: Řádek 1:
 ====== autoresearch – autonomní ML experiment loop ====== ====== autoresearch – autonomní ML experiment loop ======
 +
 +//Vytvořeno: 11.04.2026 | Aktualizováno: **~~LASTMOD~~**//
  
 [[https://github.com/karpathy/autoresearch|autoresearch]] je open-source framework od Andreje Karpathyho, který umožňuje AI agentovi autonomně provádět opakované ML experimenty bez zásahu člověka. Podle [[https://raw.githubusercontent.com/karpathy/autoresearch/master/README.md|README]] je původní záměr jednoduchý: agent upravuje trénovací kód, spustí krátký běh, změří výsledek a podle metriky rozhodne, jestli změnu ponechat. Ve videu [[https://www.youtube.com/watch?v=4Cb_l2LJAW8|Claude Code + autoresearch]] je ten samý princip ukázaný i jako obecný pattern pro autonomní experimentování mimo ML. [[https://github.com/karpathy/autoresearch|autoresearch]] je open-source framework od Andreje Karpathyho, který umožňuje AI agentovi autonomně provádět opakované ML experimenty bez zásahu člověka. Podle [[https://raw.githubusercontent.com/karpathy/autoresearch/master/README.md|README]] je původní záměr jednoduchý: agent upravuje trénovací kód, spustí krátký běh, změří výsledek a podle metriky rozhodne, jestli změnu ponechat. Ve videu [[https://www.youtube.com/watch?v=4Cb_l2LJAW8|Claude Code + autoresearch]] je ten samý princip ukázaný i jako obecný pattern pro autonomní experimentování mimo ML.
Řádek 182: Řádek 184:
  
 Jinými slovy: nejde o gradient descent nad emaily, ale o automatizovaný experiment loop s pamětí v souborech. Jinými slovy: nejde o gradient descent nad emaily, ale o automatizovaný experiment loop s pamětí v souborech.
 +
 +===== AIDE²: autoresearch nad vlastním agentem =====
 +
 +[[https://x.com/zhengyaojiang/status/2077079778793042425?s=20|Vlákno Zhengyao Jianga]] popisuje jinou, pokročilejší aplikaci téhož principu: systém AIDE² nepouští autoresearch nad řešením konkrétního úkolu, ale nad **harnessem agenta**, který takové úlohy řeší. Nejde tedy o přímé vylepšení Karpathyho repozitáře; je to dvouúrovňová optimalizace inspirovaná autoresearch patternem.
 +
 +Podle [[https://www.weco.ai/blog/first-evidence-of-recursive-self-improvement|technického popisu Weco AI]] má AIDE² dva oddělené cykly:
 +
 +  * **Inner loop** funguje jako běžný autoresearch agent: nad daným repozitářem a měřitelným cílem navrhuje, spouští a vyhodnocuje změny kódu.
 +  * **Outer loop** mění kód, prompty, práci s kontextem, vyhledávací politiku a ověřování inner-loop agenta. Kandidátní verzi agenta pustí na sadě úloh a ponechá ji pouze tehdy, když překoná dosavadní verzi.
 +
 +To odpovídá interpretaci, že „autoresearch lze ještě vylepšovat autoresearchem“, ale s důležitým upřesněním: AIDE² optimalizuje agentní scaffold, ne nutně původní ''train.py'' z Karpathyho repozitáře.
 +
 +==== Co je nutné pro důvěryhodný outer loop ====
 +
 +Pouhé maximalizování metriky inner loopu by vedlo k přeučení nebo reward hackingu. Autoři proto popisují tři pojistky:
 +
 +  * **veřejné a privátní skóre** – agent vidí veřejný signál, ale o ponechání kandidáta rozhoduje neveřejné held-out skóre;
 +  * **fixní rozpočet** – porovnávají kandidáty při stejném rozpočtu na tokeny a výpočet, takže nelze „vyhrát“ jen větším množstvím volání modelu;
 +  * **heterogenní úlohy** – inner agent se hodnotí napříč ML engineeringem, heuristickými algoritmy a agentním harnessem, aby se neoptimalizoval jen na jeden typ problému.
 +
 +Tato konstrukce je prakticky přenositelná i na jednodušší experimentální loopy: baseline a challenger musí být hodnoceny za srovnatelných podmínek a finální kritérium má být oddělené od signálu, který optimalizátor přímo vidí.
 +
 +==== Reportované změny a jejich limity ====
 +
 +V osmidenním autonomním běhu se 100 kroky outer loopu autoři uvádějí sedm postupně lepších verzí agenta. Jako nejdůležitější nalezené změny popisují:
 +
 +  * vyhledávací politiku, která kombinuje průzkum různých větví řešení s greedy výběrem uvnitř vybrané větve a větvením při stagnaci;
 +  * kontextové inženýrství – pro každou roli agenta jen minimální relevantní kontext; proti naivnímu přikládání celé historie uvádějí průměrné zmenšení promptu 16×;
 +  * vícevrstvou obranu proti reward hackingu: instrukce v promptech, hard-coded kontrolu podezřelých výstupů a statistický filtr extrémních úspěchů.
 +
 +Poslední bod je důležité číst kriticky: autoři zároveň uvádějí, že statistická vrstva v konečné verzi obsahovala chybu a reálně neměla efekt. V externích held-out benchmarkách jejich AIDE47 a AIDE85 podle reportu překonaly výchozí AIDE0 i ručně laděný AIDEhuman; na KernelBench klesla reportovaná míra reward hackingu z 63 % u AIDE0 na 34 % u AIDE85.
 +
 +===== Co z toho zatím neplyne =====
 +
 +Autoři označují výsledek za **Level 1** recursive self-improvement: při fixním rozpočtu systém podle jejich metodiky zlepšoval inner agenta efektivněji než jejich ruční R&D. Netvrdí ale „ignition“ neboli Level 2 – že takto vylepšený agent už sám dokáže lépe řídit další outer loop. Jejich přímý test měl smíšené výsledky a statisticky neprůkaznou výhodu.
 +
 +Pro praktický návrh vlastního loopu z toho plyne, že je potřeba oddělit tři věci:
 +
 +  * **objekt optimalizace** – například ''train.py'', copy kampaně nebo celý agentní harness;
 +  * **měřicí protokol** – held-out data, fixní rozpočet, dostatečný vzorek a pravidla pro promote/revert;
 +  * **udržovatelnost** – evolučně vzniklý kód může být výkonnější, ale autoři upozorňují na jeho vyšší složitost, mrtvý kód a horší nasaditelnost.
  
 ===== Jak přemýšlet o časových intervalech ===== ===== Jak přemýšlet o časových intervalech =====
Řádek 287: Řádek 330:
   * [[https://www.youtube.com/watch?v=4Cb_l2LJAW8|YouTube: Claude Code + autoresearch]]   * [[https://www.youtube.com/watch?v=4Cb_l2LJAW8|YouTube: Claude Code + autoresearch]]
   * [[https://venturebeat.com/technology/andrej-karpathys-new-open-source-autoresearch-lets-you-run-hundreds-of-ai|VentureBeat: Andrej Karpathy's new open-source autoresearch]]   * [[https://venturebeat.com/technology/andrej-karpathys-new-open-source-autoresearch-lets-you-run-hundreds-of-ai|VentureBeat: Andrej Karpathy's new open-source autoresearch]]
 +  * [[https://x.com/zhengyaojiang/status/2077079778793042425?s=20|Zhengyao Jiang – AIDE² a recursive self-improvement]]
 +  * [[https://www.weco.ai/blog/first-evidence-of-recursive-self-improvement|Weco AI – AIDE²: First Evidence of Recursive Self-Improvement]]
 +
 +==== Diskuse ve videu ====
 +
 +{{youtube>B-N_hjgBwbk?}}
 +
 +V pořadu [[https://youtu.be/B-N_hjgBwbk?si=WQbNGA6XCbVjeVwh&t=2816|Loop engineering: přestaň psát prompty, piš smyčky]] začíná diskuse o autoresearch z X od **46:56**. Embed nelze nastavit na konkrétní čas; pro otevření správného místa použij odkaz.
 +
  • ai/platformy/agenti-a-orchestrace/autoresearch.1775908168.txt.gz
  • Poslední úprava: 11.04.2026 13:49
  • autor: Petr Nosek