Сгрешен автоматично ъгъл е по-лошо от никакъв ъгъл, затова тук нищо не е автоматично: ти посочваш четирите ъгъла на листа.
Автоматичното намиране на ръбове върху произволен фон е отделна задача от компютърното зрение и видимо се влошава, щом контрастът между листа и масата намалее. Резултатът от сгрешен ъгъл е изкривена страница, която изглежда изправена, тоест грешка, която не се забелязва. Четири щраквания отнемат няколко секунди и махат целия този клас грешки.
Изкривяването на снимка, направена под ъгъл, се описва с матрица три на три с осем степени на свобода, защото деветият елемент е мащабен множител и не носи нова информация. Оттам идват и осемте уравнения: всеки от четирите ъгъла дава по две, за хоризонтала и за вертикала. Четири посочени ъгъла са точно толкова, колкото задачата иска, нито повече, нито по-малко.
A4 и Letter се отпечатват в истински физически размер, тоест сканиран лист излиза колкото е бил. Третата възможност запазва пропорцията по измерените ъгли и е за нещо, което не е A4: картичка, бележка, талон. Разтягането им до A4 щеше да ги направи неверни, вместо да ги направи удобни.
След изправянето страницата се изчиства, за да стане четима: изравнява се осветеността и се подсилва контрастът между текста и хартията. Целта не е красива снимка, а страница, от която се чете и се разпознава текст без да се гадае.
Цялата задача се решава с около деветдесет реда линейна алгебра, вместо с библиотека за компютърно зрение, която тежи повече от целия останал инструмент. Това не е самоцел: по-малкият код се зарежда по-бързо и работи и на слаб телефон, който е точно устройството, с което най-често се снима документ.
Изправената страница е готовият вход за разпознаване на текст: OCR работи много по-добре върху изправен лист с равномерна осветеност, отколкото върху снимка под ъгъл. Ако страниците са няколко и трябва да станат един файл, за подреждането и завъртането има отделен инструмент за PDF.
Три неща развалят повече страници от всичко останало. Сянка от телефона или от ръката върху листа, която прави едната половина по-тъмна от другата. Ъгъл, при който единият край на листа е чувствително по-далеч от другия, тоест буквите там са видимо по-малки. И лист, който не се побира изцяло в кадъра, защото отрязаният ъгъл не може да бъде посочен. Всяко от трите се оправя за секунди преди снимката и не се оправя добре след нея.
Защото автоматичното намиране на ръбове върху произволен фон греши точно когато контрастът е слаб, а сгрешен ъгъл дава изкривена страница, която изглежда изправена.
Защото изкривяването се описва с матрица три на три с осем степени на свобода, а всеки ъгъл дава две уравнения. Четири ъгъла дават точно осемте, които задачата иска.
Да, при избор на A4 или Letter. Третата възможност пази пропорцията по измерените ъгли и е за нещо, което не е с формат на лист.
Изравнява осветеността и подсилва контраста между текста и хартията, за да стане страницата четима, а не просто по-красива.
Да. Задачата се решава с около деветдесет реда линейна алгебра, без тежка библиотека, точно за да върви и на слаб телефон.
Да, изправената страница е най-добрият вход за разпознаване на текст. OCR върху изправен лист е чувствително по-точен, отколкото върху снимка под ъгъл.
Че страницата запазва собствената си пропорция вместо да бъде разтеглена до A4. Това е изборът за нещо, което не е лист: картичка, бележка или талон, където разтягането до формат на лист прави размерите неверни.
Защото снимка под ъгъл е изкривена, а осветеността ѝ е неравна. Изправената страница се чете по-лесно от човек, печата се в истински размер и дава чувствително по-точно разпознаване на текст.
За подреждане, завъртане и обединяване на страници в един файл има отделен инструмент за PDF.