Точность распознавания: замер по каждому файлу

Пять сканов из папки «Файлы» прогнаны через работающее приложение и сверены с вашим же эталонным разбором. Заранее заготовленных ответов нет.

82.4 %
значений таблицы прочитано верно: 271 из 329 по всем пяти документам (47 строк товара × 7 значений в строке)

Итог считается по сумме значений всех документов, а не как среднее из процентов: документы разной длины, иначе короткий документ весил бы столько же, сколько длинный.

По каждому файлу

ДокументСтрок товараВсего значенийСовпало с эталономПроцентСтрок не прочитаноЛишних строк
Пример 1 — № 25
0d7b0e7c-e4b6-40b4-9a62-6eec02c07c12.pdf, 2 стр.
2014013395.0 %016
Пример 2 — № 4
1c6c0fac-f82a-4219-be4b-4918653068f4.pdf, 2 стр.
535617.1 %11
Пример 3 — № 756
1f0b3cfd-c38a-433c-a029-5122aab57d6b.pdf, 1 стр.
1700.0 %16
Пример 4 — № ЦБ-444
2b0791f5-c8d2-4157-beea-e8fe6c362de8.pdf, 1 стр.
3211676.2 %012
Пример 5 — № 1189/4
3e43a1d4-288d-42ec-989a-385ff87719d4.pdf, 2 стр.
1812611692.1 %08
Итого по пяти документам4732927182.4 %243

Прогон занял 491.5 с на пять документов. Значение засчитано, только если число совпало с эталоном до копейки, наименование — не менее чем на 90 % символов, ставка НДС найдена в строке. Непрочитанная строка остаётся в знаменателе целиком (семь неверных значений).

Что именно ломается

Что происходитЗначенийДоля от всех ошибок
таблица не разбита на ячейки — строка ушла в сплошной текст
Наименование и числа строки на странице прочитаны, но границы строк и колонок не найдены: строка не попала в таблицу, и все семь её значений считаются неверными.
711.9 %
строка не прочитана совсем
Строки нет ни в таблице, ни в тексте страницы: все семь её значений неверны.
711.9 %
значение уехало в соседнюю колонку
Число в документе есть, но стоит не в своей колонке — при чтении по ячейкам попало в чужую.
11.7 %
потерян разделитель разрядов
Те же цифры без пробела и запятой: 21 902,40 прочитано как «2190240».
35.1 %
перепутаны цифры
Число прочитано, но одна-две цифры не те (0 и 8, 5 и 6, 1 и 7).
610.2 %
число не найдено совсем
Значения нет в строке ни в каком виде — колонка не прочиталась.
1322.0 %
наименование склеено с соседней колонкой
В ячейку наименования затянуло код, единицу измерения или количество из соседней колонки.
813.6 %
наименование прочитано с ошибками
Совпало меньше 90 % символов: перепутаны буквы, потеряны части слов.
813.6 %
ставка НДС не прочитана
В строке нет «20 %» — колонка ставки потерялась или слилась с соседней.
610.2 %
Всего неверных значений58100 %

Строка «значение уехало в соседнюю колонку» считается по строкам, а не по значениям, поэтому сумма причин может отличаться от числа неверных значений.

Разбор по каждому файлу

Пример 1 — № 25, 95.0 %
Пример 2 — № 4, 17.1 %
Пример 3 — № 756, 0.0 %
Пример 4 — № ЦБ-444, 76.2 %
Пример 5 — № 1189/4, 92.1 %

Перекос

Все пять ваших сканов лежат ровно: измеренный перекос страниц — 0°, поэтому на этих документах перекос ничего не портит. Чтобы проверить, что будет на кривом скане, тот же «Пример 1» повернули на 6.5°, добавили тень и шум и прогнали заново.

СканЗначений верноПроцентСтрок не прочитано
Пример 1, ровный—95.0 %0
та же страница, поворот 6.5°, тень и шум38 из 14027.1 %14

Кривая копия — не ваш документ, в общий процент она не входит и показана отдельно.

Как это считалось

Правила подсчёта — те же, что на странице проверки распознавания: одно правило, один источник чисел.