Tagged
#ocr
이 주제로 쓴
3개의 글
-
두 번째 앱 출시기 1 — 한글이 검색되는 PDF 만들기 - OCR 인식 좌표와 글자층
첫 번째 앱 Stock Calculator에 이어 두 번째 앱 Pocket PDF를 만들었습니다. 이미지를 PDF로 변환하면서 텍스트를 인식해 투명 글자층으로 얹는 핵심 엔진 개발과 한글 유니코드 문제를 해결한 과정을 정리합니다.
-
안드로이드를 만들며 11 — 글자층을 싣는 것과 검색이 되는 것은 다른 말입니다
이미지 스캔본 위에 투명 텍스트를 얹어 검색 가능한 PDF를 만들었습니다. 그런데 글꼴 파일이 PDF에 들어갔다는 것과 뷰어에서 실제로 검색이 된다는 것은 전혀 다른 문제였습니다. ToUnicode 맵과 폰트 서브셋 베이킹의 집착을 정리합니다.
-
조용히 실패하는 것들 6 — «검색되는 PDF»가 한글은 한 글자도 검색하지 못했어요
홈 화면은 «검색되는 문서로 만들어 드려요»라고 말하고 있었습니다. 그런데 코드 깊은 곳에는 «코드값 256 위는 공백으로»라는 한 줄이 있었어요. 한글은 U+AC00부터 시작합니다. 주 시장의 언어가 통째로 공백이 되고 있었습니다.