AlligatorC0der

3 mods across 1 repository, 0 stars between them.

conkurrence

01

AlligatorC0der/conkurrence

Plugin Claude Code

AI evaluation toolkit — measure inter-rater agreement across multiple LLM providers using Fleiss' kappa and Kendall's W.

0 4mo ago A tokens not measured

conkurrence

02

AlligatorC0der/conkurrence

Plugin Claude Code

Statistically validated consensus measurement for AI evaluation pipelines. Uses multiple AI models as independent raters, measures inter-rater reliability with Fleiss' kappa and bootstrap confidence intervals, and routes contested items to human experts.

0 4mo ago A tokens not measured

conkurrence

03

AlligatorC0der/conkurrence

MCP server Claude CodeCodexCursor

Measure whether your AI agrees with itself using statistical consensus metrics. Runs locally from the conkurrence npm package.

0 4mo ago A tokens not measured