Качваш снимка или скан, избираш език и получаваш текст, а разпознаването върви в твоя браузър, не на чужд сървър.
Разпознаването върви като WebAssembly вътре в раздела на браузъра, направо върху пикселите в паметта. Изображението не напуска машината ти. Това има значение при документ с лични данни повече, отколкото при обикновена снимка, и точно затова е поведението по подразбиране, а не опция.
Изборът на език не е само настройка: той тегли данни. Българският пакет е 1,6 MB, английският 3,9 MB, а двата заедно 5,5 MB. Затова инструментът показва размера при избора, вместо да изтегли мълчаливо повече, отколкото ти трябва.
Разпознаващият модел тежи много по-малко, отколкото хората предполагат. Сянка върху страницата, наклонен лист или грешен праг на превръщане в черно и бяло развалят резултата, преди моделът изобщо да получи шанс. Точно затова прагът е видима настройка, а не скрита подробност.
Като правило: глобален праг за истински скан, локален за снимка от телефон. Глобалният избира една стойност на яркост за цялото изображение и работи добре при равномерно осветена страница. Локалният решава за всяка област поотделно и затова се справя със сянка от ръка или от лампа.
Разпознат български текст понякога изглежда правилен и не се търси. Причината обикновено е буква, която на екран изглежда кирилска, а е латинска, или обратното: А, В, Е, К, М, Н, О, Р, С, Т, У и Х имат еднакви форми в двете азбуки. Затова резултатът се проверява със същото внимание, с което се проверява и превод.
Разпознаването иска буквите да са поне около 10 пиксела високи и работи най-добре при 20 до 30 пиксела. За обикновена страница A4 това значи скан от порядъка на 300 точки на инч. Инструментът не поправя перспектива: за снимка на лист под ъгъл първо минава скенерът за документи. И не разпознава ръкопис.
Разпознаването зависи повече от снимката, отколкото от модела, затова си струва минутата преди щракването. Осветлението да е равномерно, без сянка от ръката или от собственото тяло върху страницата. Телефонът да е успореден на листа, не под ъгъл, защото наклонът разваля редовете. Страницата да пълни кадъра, за да са буквите достатъчно високи. И листът да е притиснат или поне равен: гънката хвърля собствена сянка и точно тя обърква прага. Едно допълнително правило спестява половината несполуки: снимай на дневна светлина до прозорец, а не под една лампа над главата си, защото точковият източник винаги оставя сянка някъде.
Не. Разпознаването върви като WebAssembly вътре в браузъра, направо върху пикселите в паметта, и изображението не напуска машината ти.
Българският е 1,6 MB, английският 3,9 MB, а двата заедно 5,5 MB. Размерът се показва при избора на език.
Глобален за истински скан, локален за снимка от телефон. Локалният решава за всяка област поотделно и затова се справя със сянка.
Защото част от буквите имат еднаква форма в кирилица и латиница. Разпозната латинска буква вътре в българска дума изглежда нормално на екран и се хваща чак при търсене.
Буквите да са поне около 10 пиксела високи, а най-добре 20 до 30. За обикновена страница A4 това значи скан около 300 точки на инч.
Защото проектът зад разпознаването публикува няколко варианта на езиковите данни: най-точния и най-тежкия, стандартния и бърз олекотен вариант. Тук е избран такъв, който се тегли бързо и върши работа на обикновена страница, вместо да бави отварянето заради точност, която повечето документи не изискват.
Не. Разпознаването е за печатен текст.
Защото превръщането в черно и бяло става по праг на яркост. Сянката мени яркостта в част от страницата и там буквите или изчезват, или се сливат. Локалният праг помага, но равномерната светлина помага повече.
Първо мини през скенера за документи: той изправя перспективата и дава чиста страница, която вече се разпознава добре.