Article
Graduated Dissent: Budgeted Disagreement Resolution for Multi-Model Inference
2026-05-26
Abstract excerpt
Recent empirical work demonstrates that large language models cannot reliably self-correct reasoning without external feedbac [2], and large-scale evaluation across hundreds of models reveals substantial error correlation even between models with distinct architectures and providers [4]. When generator and evaluator share failure modes, self-evaluation may provide weak evidence of correctness, and repeated self-cr...
Topics
Open a Topic to create a Post that cites this publication.
Identifiers and source
- Literature Corpus work
- 99d9715e-ce4f-5b7d-91c8-197f840d81c9
- DOI
- 10.20944/preprints202603.1830.v2
