conkurrence
01Plugin Claude Code
AI evaluation toolkit — measure inter-rater agreement across multiple LLM providers using Fleiss' kappa and Kendall's W.
0 4mo ago A
tokens not measured
Plugin Claude Code
AI evaluation toolkit — measure inter-rater agreement across multiple LLM providers using Fleiss' kappa and Kendall's W.
Plugin Claude Code
Statistically validated consensus measurement for AI evaluation pipelines. Uses multiple AI models as independent raters, measures inter-rater reliability with Fleiss' kappa and bootstrap confidence intervals, and routes contested items to human experts.
MCP server Claude CodeCodexCursor
Measure whether your AI agrees with itself using statistical consensus metrics. Runs locally from the conkurrence npm package.