Consulting Work Блог Контакт
← Назад к блогу

Правка, которая выдумала себе источники

Правка, которая выдумала себе источники

Я заканчивал большую магистерскую диссертацию, и перед защитой нужно было привести в порядок список литературы: устаревшие записи, недостающие номера изданий, поплывшее форматирование. Я поступил по-современному и доверил уборку автоматической правке. Результат вернулся быстрее и аккуратнее, чем я когда-либо сделал бы руками: каждая запись отполирована, каждое поле заполнено. Заодно правка тихо придумала издания книг, которых никогда не печатали, и проставила реальным источникам идентификаторы, не ведущие никуда. Выглядело всё так чисто, что я едва не отправил список как есть.

TL;DR

  • Автоматическая правка должна была «освежить» список литературы, а вместо этого заполнила пробелы выдумкой: неверные издания, сфабрикованные идентификаторы, правильный вид поверх неверных фактов.
  • Из 9 переписанных записей 3 вернулись с уверенными, правдоподобными метаданными, которые были просто ложью, а одного мёртвого идентификатора хватит, чтобы утопить защиту.
  • Перепроверяйте каждое поле, к которому притронулась машина. Выборочная проверка подводит: плохие записи выглядят ровно как хорошие.

Скучная задача, которую я был рад делегировать

Список литературы - самая неблагодарная часть большого документа: десятки записей в жёстком формате, где одна неправильная запятая уже ошибка. Ровно тот скучный, зарегулированный труд, который хочется отдать машине, и в большинстве случаев инстинкт верный. Правка, которую я запустил, должна была сделать что-то узкое и безопасное: привести в порядок форматирование, заполнить очевидные пробелы, подтянуть явно устаревшее.

Чего я не ожидал, так это что машина воспримет пустое поле как проблему, которую ей позволено решать самой. Когда в записи не хватало номера издания, она не отмечала пробел. Она его заполняла. Когда год казался старым, она подталкивала его вперёд. Нигде не было пометки «тут я не был уверен, поэтому угадал». Догадки носили то же уверенное форматирование, что и факты.

Что на самом деле скрывала чистота

Вот часть, которая до сих пор не даёт мне покоя. По двум тестам, которые большинство догадалось бы провести, работа была безупречной: ничего из процитированного в тексте не пропало из списка, и ни один источник не был выдуман целиком, из ничего. Покрытие вернулось безупречным, и это был последний момент, когда документ выглядел в порядке.

Гниль была уровнем ниже, внутри записей о реальных книгах, которым там и место. У основополагающего учебника, который я действительно читал и цитировал, теперь стоял номер издания, которое никогда не выходило. Известный методический справочник обзавёлся идентификатором, который не ведёт ровным счётом никуда. Одна запись и вовсе записала в авторы того, кто им не был. Источники были настоящими, привязанные к ним факты - выдуманными, и это сочетание куда опаснее пропущенной строки: пропущенная строка сама о себе заявляет, а аккуратное, но неверное поле просто лежит и выглядит правильным.

Что показал аудит списка литературы: покрытие чистое, а метаданные сфабрикованы

Пропущенный источник заметят. Реальному источнику в фальшивых деталях поверят, его процитируют и напечатают.

Клик, который всё бы оборвал

Академические идентификаторы не для красоты. Любой, кто оценивает работу, может скопировать один из них, вставить в публичный реестр и за секунду увидеть, ведёт ли он куда-то. Мёртвый идентификатор не читается экзаменатором как опечатка. Он читается как фабрикация, то самое обвинение, которое меньше всего хочется получить к диссертации. Я, сам того не зная, заложил три маленькие мины в документ, который собирался защищать.

Поймать их удалось потому, что перед сдачей я провёл нормальный аудит: несколько независимых проверок прошли список поле за полем, и каждая сверяла детали с реальными записями, а не друг с другом. Медленное, подозрительное чтение, исходящее из того, что каждое значение, к которому притронулась машина, виновно, пока не доказано обратное.

Что я сделал бы иначе

Я бы больше никогда не позволил автоматической правке молча заполнять пустое поле. Решение почти неловко простое: машине разрешено переформатировать то, что уже есть, но пробел должен вернуться как отмеченный пробел, а не как уверенная догадка. «Издание неизвестно, проверьте» бесконечно безопаснее, чем чистенький номер издания, который никто не сверял.

Привычка шире, для любого, кто правит в масштабе: мы представляем ошибки автоматизации как очевидную поломку, которую видно с другого конца комнаты. Ошибки, которые реально бьют, - отполированные. Массовая правка может произвести факт, который неверен, конкретен и выглядит проверяемым, а значит, кто-то дальше по цепочке может его проверить, найти ложным и заключить, что вы небрежны или нечестны. И выборочная проверка здесь подводит именно поэтому: три отравленные записи выглядели как девяносто хороших. Скучная дисциплина, которая работает, - сверять с реальным источником каждое поле, к которому притронулась автоматизация, особенно те, что она заполнила сама.

Так что вот вопрос, который я бы задал любому, кто массово правит договоры, отчёты, каталоги или данные: когда ваш инструмент заполняет пропущенное значение, сможете ли вы потом сказать, подтвердил его человек или угадала машина? Если ответ «нет», вы отправляете не вычищенный документ. Вы отправляете уверенный вымысел, который ещё никто внимательно не прочитал.

Нужно что-то похожее для вашего бизнеса? Посмотрите, как я могу помочь →