hypothesis
01Agent
Analysiere Eval-Failures / Metrik-Ergebnisse und generiere eine testbare Verbesserungshypothese.
Autonomous AI skill improvement through iterative experimentation — inspired by Karpathy's autoresearch. An agent mutates skill instructions, evaluates against objective metrics, keeps improvements, reverts regressions. No human in the loop.
Agent
Analysiere Eval-Failures / Metrik-Ergebnisse und generiere eine testbare Verbesserungshypothese.
Agent
Destilliere aus den bisherigen Experimenten, wie für diesen Skill eine gute Änderung aussieht.
Agent
Wende eine Hypothese als gezielte Änderung auf die Zieldateien an.
Agent
Koordiniert den Agent-Lifecycle im Skill Forge Loop.
Agent
Bewerte die Qualität eines Skill-Outputs auf einer normierten Skala.