이미지 속 문장 복사
캡처된 에러 메시지, 안내 문구, 스캔 문서 일부를 다시 타이핑하지 않고 텍스트로 추출합니다.
브라우저 내부 처리
이미지에서 한국어와 영어 텍스트를 추출합니다.
스캔한 PDF나 휴대폰으로 찍은 문서에서는 텍스트 추출이 빈 결과를 내놓습니다. 페이지 전체가 이미지 한 장이라 파일 안에 글자 데이터가 없기 때문입니다. 그럴 때 이미지에서 글자를 찾아 복사 가능한 문자열로 만드는 것이 OCR입니다. 인식률은 해상도가 좌우하므로 축소한 스크린샷보다 원본을 넣는 편이 낫습니다.
캡처된 에러 메시지, 안내 문구, 스캔 문서 일부를 다시 타이핑하지 않고 텍스트로 추출합니다.
한국어와 영어가 섞인 화면을 대상으로 빠르게 초안을 뽑고, 결과는 사람이 한 번 더 교정하는 흐름에 맞췄습니다.
선택한 이미지는 브라우저에서 OCR 처리되며, 이 도구가 별도 서버에 이미지를 저장하지 않습니다.
해상도가 가장 큰 변수입니다. 확대해서 다시 캡처하거나, 스캔이라면 300 DPI 이상으로 받으세요. 기울어진 사진은 수평을 맞추면 정확도가 확 올라갑니다.
인식 언어를 지정하면 결과가 나아집니다. 다만 한 이미지에 두 언어가 섞이면 어느 쪽이든 오인식이 늘어나므로 결과는 반드시 검수하세요.
이 도구는 인쇄체를 전제로 합니다. 손글씨 인식은 별도 모델이 필요해 기대만큼 나오지 않습니다.
흐림, 기울어짐, 낮은 대비, 작은 글자는 인식률을 크게 떨어뜨립니다. 가능하면 원본 해상도와 선명한 캡처를 사용하세요.
OCR은 보조 도구입니다. 계약서, 금액, 계좌번호처럼 정확도가 중요한 텍스트는 원본과 대조해야 합니다.
글자 높이가 20픽셀 아래로 내려가면 인식이 급격히 떨어집니다. 화면을 축소해 찍은 스크린샷보다 원본 해상도로 다시 캡처하는 편이 훨씬 낫습니다. 기울어진 사진은 먼저 수평을 맞추세요.
OCR은 글자를 찾는 일이고 문서 구조를 이해하지는 않습니다. 표는 셀 구분이 사라지고 2단 편집은 좌우가 번갈아 나옵니다. 결과를 그대로 쓰기보다 정리 단계를 두는 편이 빠릅니다.
0과 O, 1과 l과 I, 5와 S는 인식이 자주 뒤바뀝니다. 계좌번호, 주문번호, 시리얼처럼 한 글자가 치명적인 값은 반드시 눈으로 대조해야 합니다. 자동으로 다음 단계에 넘기는 파이프라인에는 검증을 두세요.
입력
오류 메시지가 담긴 스크린샷 (PNG)
결과
Connection refused: could not connect to server at 127.0.0.1:5432
오류 메시지를 다시 타이핑하지 않고 바로 검색하거나 붙여 넣을 수 있습니다.