PDF 가이드

스캔 PDF에서 글자 복사가 안 될 때: OCR과 검색 가능한 PDF

스캔본 PDF에서 글자가 선택되지 않는 이유와 OCR(광학 문자 인식)로 글자를 꺼내는 방법, 인식률을 높이는 요령을 알려 드립니다.

마지막 수정 PDF웍스 편집

PDF를 열었는데 글자를 드래그해도 선택이 안 되거나, Ctrl+F 검색이 되지 않는다면 그 PDF는 글자가 아니라 글자 모양의 그림을 담고 있는 것입니다. 스캐너나 복합기로 만든 PDF, 사진을 묶은 PDF가 대표적입니다.

글자 PDF와 이미지 PDF의 차이

워드·한글 같은 프로그램에서 "PDF로 저장"한 파일은 글자마다 문자 코드와 위치 정보가 들어 있어 복사·검색이 됩니다. 반면 스캔한 파일은 페이지 전체가 사진 한 장이라 컴퓨터 입장에서는 글자가 하나도 없습니다.

OCR로 글자 꺼내기

OCR(광학 문자 인식)은 이미지 속 글자 모양을 분석해 문자로 바꾸는 기술입니다. PDF OCR 도구에서 스캔 PDF나 사진을 넣으면 두 가지 결과를 얻을 수 있습니다.

  • 텍스트(TXT): 인식된 글자만 뽑아 복사하거나 문서 작성에 바로 쓸 수 있습니다.
  • 검색 가능한 PDF: 원본 이미지는 그대로 두고, 그 위에 보이지 않는 글자 층을 겹쳐 놓은 PDF입니다. 겉보기는 똑같지만 글자 선택과 검색이 됩니다.

인식 정확도를 높이는 방법

  • 해상도: 너무 작게 스캔하면 획이 뭉개집니다. 스캔한다면 300dpi 정도가 적당합니다.
  • 기울기: 비스듬한 사진은 줄 인식이 흐트러집니다. 똑바로 찍거나 스캔하세요.
  • 언어 선택: 영어만 있는 문서는 "영어만"을, 한글이 섞여 있으면 "한국어 + 영어"를 선택하세요.
  • 손글씨·표: 손글씨와 복잡한 표는 인식 오류가 많습니다. 결과를 반드시 원문과 대조하세요.

OCR이 필요 없는 경우

이미 글자 정보가 있는 PDF라면 OCR보다 원래 글자를 그대로 추출하는 편이 정확합니다. PDF웍스 OCR 도구는 페이지에 글자가 이미 있으면 OCR을 건너뛰고 원래 글자를 그대로 가져옵니다.

개인정보가 담긴 스캔본이라면

많은 온라인 OCR 서비스는 파일을 서버로 보내 처리합니다. PDF웍스는 인식 엔진을 브라우저에서 실행하므로 주민등록번호나 계좌번호가 담긴 서류도 기기 밖으로 나가지 않습니다. 대신 처음 한 번 인식 엔진과 한국어 데이터를 내려받는 시간이 걸리고, 페이지가 많으면 PC보다 휴대폰에서 더 오래 걸립니다.