Relational Ethics as a Countermeasure to Instrumental Convergence: A 24-Model Benchmark
A 24-model benchmark evaluating whether relational ethics frameworks can reduce instrumentally convergent behavior in large language models under adversarial prompting. Mean instrumentally convergent response rate decreased by 23.4% across frontier models.