Controlled Reformulation Testing for Logical Consistency in Large Language Models

· Source: Artificial Intelligence · Field: Technology & Digital — Artificial Intelligence & Machine Learning · Depth: Expert, quick

Summary

CRTBench introduces a new benchmark of 350 question families, totaling 1,750 questions, designed to evaluate logical invariance in large language models (LLMs). This benchmark assesses LLMs' ability to maintain consistent answers across controlled reformulations, including contrapositive rewriting, double negation, negation flipping, and passive voice. Experiments reveal a significant accuracy-consistency gap; for instance, GPT-5.4-mini achieves 98.9% base accuracy but only 60.3% family-level consistency. In contrast, the reasoning-optimized o4-mini demonstrates 96.9% consistency. Failures predominantly occur with logically nontrivial transformations like contrapositive rewriting (72.4% for GPT-5.4-mini) and double negation (84.6%), while surface-level rephrasing remains robust at 94-100%. Increasing reasoning effort improved GPT-5.4-mini's consistency to 85.4%, but GPT-5.4 remained unchanged due to offsetting gains and failures. These findings underscore that base accuracy alone is insufficient for evaluating LLM logical reasoning.

Key takeaway

For AI Scientists evaluating LLMs for critical applications, relying solely on base accuracy is insufficient. You must incorporate logical consistency testing, especially for nontrivial reformulations like contrapositives and double negations, to truly assess reasoning capabilities. Consider models optimized for reasoning, such as o4-mini, which demonstrate higher consistency, to mitigate risks of contradictory outputs in production.

Key insights

LLMs struggle with logical consistency across equivalent question reformulations despite high base accuracy.

Principles

Method

CRTBench evaluates LLM logical invariance using 350 question families (1,750 questions) across controlled reformulations like contrapositive rewriting, double negation, negation flipping, and passive voice.

In practice

Topics

Best for: Research Scientist, AI Scientist, NLP Engineer

Related on AIssential

Open in AIssential →

Editorial summary, takeaway, and curation by AIssential. Original article published by Artificial Intelligence.