Неудачное решение обрастает костылями, пока модель защищает первую догадку. Я встроил обсуждение четырёх ролей перед первой правкой и проверил схему в 480 запусках. Удалось сэкономить 4,5 млн токенов — и найти ошибку, из-за которой агенты продолжали спорить, когда их ответы ещё нельзя было сравнить.

Читать далее