proofrag
01Command
Evaluate a RAG/LLM app — generate a golden set, judge it, and produce a scorecard.
2 22d ago A 22 tokens
original MIT
Point your agent at your docs and your RAG app; get a golden test set + an LLM-as-judge & retrieval scorecard, in one command.