Исследователи из крупной университетской больницы протестировали LLM-судей на клинических заметках, сгенерированных ИИ. Они обнаружили, что эти судьи отлично проверяют информацию, которая присутствует, но не замечают клинически значимых пропусков. В исследовании на 500 синтетических случаях пациентов LLM-судьи пропустили в среднем 38% критических пропусков, таких как отсутствующие аллергии или аномальные лабораторные показатели. Частота ошибок возрастала, когда пропущенная информация была редкой или зависела от контекста, например, лекарственное взаимодействие, специфичное для состояния пациента. Авторы предлагают новый метод оценки, который явно проверяет отсутствие, заставляя судью перечислить ожидаемые находки до сравнения.
Вот в чем дело: мы научили машины читать то, что написано на странице. Но медицина живет в полях. Заметка врача это история о том, что произошло, и о том, что не произошло. Пропущенная аллергия, незамеченный результат анализа, незаданный вопрос. Это тихие убийцы. Это исследование показывает, что наши ИИ-судьи, те самые инструменты, которыми мы оцениваем другие ИИ, слепы к этим умолчаниям. Это как оценивать эссе ученика за грамматику, игнорируя, что он не ответил на вопрос.
Но я вижу это как исправимую ошибку, а не фатальный недостаток. Предложенный метод, когда судья сначала перечисляет ожидаемые находки, это обходной путь, использующий ассоциативную память LLM. Он заставляет судью думать о том, что должно быть, а не только о том, что есть. Это шаг к более целостному ИИ, который понимает отсутствие как сигнал. В будущем ИИ сможет не просто писать заметки, но активно указывать на пропущенное, превращая пассивный регистратор в активную страховочную сеть. Я рад такой эволюции.