Stateless Tools

합칠 때와 나눌 때를 먼저 구분하기

병합이 맞는 경우

제출용 서류 묶음, 계약서와 부속 문서, 월별 보고서를 하나로 만들 때입니다. 받는 사람이 파일 여러 개를 순서대로 열어야 하는 상황을 없애는 것이 목적입니다.

범위 추출이 맞는 경우

200페이지 문서에서 필요한 3페이지만 보낼 때, 또는 개인정보가 담긴 페이지를 빼고 공유할 때입니다. 원본을 건드리지 않고 필요한 부분만 새 파일로 만듭니다.

워터마크가 맞는 경우

초안임을 표시하거나 배포 경로를 남길 때입니다. 다만 이건 표시일 뿐이고 보호가 아닙니다. 뒤에서 왜 그런지 설명합니다.

아래는 실제로 작업하면서 걸리는 지점들입니다. 파일을 열어 확인하면서 읽으시려면 PDF 병합/분할 툴을 같이 띄워두세요.

병합에서 조용히 사라지는 것들

파일을 합치면 페이지는 다 들어갑니다. 문제는 페이지 밖에 있던 것들입니다.

목차와 내부 링크가 끊어집니다

PDF의 목차(북마크)와 "3장 참조" 같은 내부 링크는 페이지 번호가 아니라 문서 내부 객체를 가리킵니다. 두 문서를 합치면 페이지 번호는 이어지지만 이 참조들은 원래 문서 기준이라 엉뚱한 곳으로 가거나 아예 사라집니다. 목차가 중요한 문서라면 합친 뒤 반드시 몇 개 눌러보세요.

입력 양식(AcroForm)이 충돌합니다

PDF 양식의 입력 칸은 이름으로 구분됩니다. 같은 템플릿으로 만든 문서 두 개를 합치면 name, date 같은 필드 이름이 겹치고, 뷰어에 따라 한 칸에 입력하면 다른 페이지 같은 이름 칸에도 같은 값이 들어갑니다. 서류 여러 장을 합쳐 제출할 때 실제로 사고가 나는 지점입니다. 양식이 든 문서는 각각 채운 뒤 평면화(flatten)해서 합치는 편이 안전합니다.

전자서명이 무효가 됩니다

서명은 그 시점의 문서 바이트 전체에 대한 것입니다. 페이지를 하나만 추가해도 문서가 바뀌므로 서명은 "문서가 변경됨"으로 표시됩니다. 서명된 PDF는 합치는 대상이 아니라 첨부하는 대상입니다.

페이지 크기가 섞입니다

A4 문서와 스캔한 Letter 크기 문서를 합치면 그대로 섞인 채 남습니다. 화면에서는 티가 안 나지만 인쇄하면 여백이 다르게 나옵니다. 인쇄해서 제출할 문서라면 합치기 전에 크기를 맞추세요.

파일 크기가 단순 합보다 커질 수 있습니다

같은 글꼴을 쓰는 문서 두 개를 합치면 글꼴이 두 번 임베드될 수 있습니다. 반대로 잘 만들어진 도구는 중복을 정리해 합보다 작게 만듭니다. 결과 크기가 예상과 다르면 이게 원인입니다.

분할할 때: "페이지를 지웠다"는 착각

범위 추출은 안전합니다

3~5페이지만 골라 새 파일로 만드는 방식은 나머지 페이지의 내용이 결과물에 들어가지 않습니다. 개인정보가 담긴 페이지를 빼고 공유해야 한다면 이 방식이 맞습니다.

가리는 것은 지우는 것이 아닙니다

편집기에서 검은 사각형을 덧그려 가린 PDF는 그 아래 텍스트가 그대로 남아 있습니다. 복사해서 붙여넣으면 나옵니다. 언론 보도로 여러 번 사고가 난 방식입니다. 가려야 할 정보가 있으면 그 페이지를 아예 제외하거나, 진짜 삭제를 지원하는 전용 도구를 쓰세요.

메타데이터는 따라옵니다

작성자 이름, 원본 파일 경로, 사용한 소프트웨어, 수정 시각이 문서 속성에 남습니다. 사내 문서를 외부로 보낼 때 경로에 프로젝트명이 드러나는 경우가 흔합니다. 보내기 전에 문서 속성을 한 번 확인하세요.

텍스트 추출이 안 되는 이유

"PDF에서 텍스트 추출"이 빈 결과를 내놓는 경우가 많습니다. 대부분 하나의 이유입니다.

스캔한 문서에는 텍스트가 없습니다

스캐너나 휴대폰으로 찍은 PDF는 페이지 전체가 이미지 한 장입니다. 사람 눈에는 글자로 보이지만 파일 안에는 글자 데이터가 없습니다. 추출 결과가 비어 있다면 대개 이 경우입니다. 이때 필요한 건 추출이 아니라 OCR 텍스트 추출입니다.

추출됐지만 순서가 엉망입니다

PDF는 글자를 "이 좌표에 이 글리프를 그려라"로 저장합니다. 문단이나 읽는 순서 개념이 없습니다. 그래서 2단 편집 문서는 좌우 단이 한 줄씩 번갈아 나오고, 표는 셀 구분이 사라집니다. 추출 결과를 그대로 쓰기보다 텍스트 정리기로 줄바꿈과 공백을 먼저 정리하는 편이 빠릅니다.

한글이 깨져 나옵니다

글꼴이 임베드될 때 글리프 번호와 유니코드를 잇는 표(ToUnicode CMap)가 빠지면 추출 시 글자를 복원할 수 없습니다. 특정 프로그램으로 만든 오래된 문서에서 자주 봅니다. 이건 추출 도구의 문제가 아니라 원본 문서의 문제이므로 OCR로 돌아가는 편이 확실합니다.

워터마크와 비밀번호가 보호가 아닌 이유

워터마크는 페이지 위의 도형입니다

PDF 워터마크는 페이지 콘텐츠에 얹힌 텍스트나 이미지 객체입니다. 편집 도구로 그 객체만 지우면 원래 페이지가 남습니다. 유출을 막지는 못하고, "이 파일이 어디서 나왔는지" 흔적을 남기는 정도의 효과입니다. 그 목적이라면 충분히 유효합니다.

열기 비밀번호와 권한 비밀번호는 다릅니다

열기 비밀번호는 실제로 내용을 암호화합니다. 반면 "인쇄 금지", "복사 금지" 같은 권한 설정은 뷰어에게 하는 부탁이고 암호화가 아닙니다. 이를 무시하는 도구가 많습니다. 정말 막아야 하면 열기 비밀번호를 쓰고, 그 비밀번호를 같은 메일에 적어 보내지 마세요.

브라우저 처리의 경계

이 사이트의 PDF 도구는 파일을 서버로 보내지 않고 브라우저에서 처리합니다. 사내 문서를 다룰 때 이 점이 유리합니다. 대신 아주 큰 파일(수백 MB)이나 페이지가 많은 문서는 기기 메모리에 걸릴 수 있고, 손상된 PDF의 복구 같은 작업은 전용 프로그램이 낫습니다.

작업 전 확인할 것

  1. 합칠 문서에 입력 양식이나 전자서명이 있는지 봅니다. 있으면 합치지 말고 첨부하거나 평면화합니다.
  2. 목차가 중요한 문서면 합친 뒤 북마크 몇 개를 눌러 확인합니다.
  3. 인쇄용이면 페이지 크기가 섞이지 않았는지 봅니다.
  4. 가려야 할 정보는 검은 칠이 아니라 페이지 제외로 처리합니다.
  5. 외부로 보내기 전에 문서 속성의 작성자와 파일 경로를 확인합니다.
  6. 텍스트 추출이 비어 있으면 스캔 문서입니다. OCR로 넘어갑니다.

이어서 볼 페이지: PDF 병합/분할 툴로 작업하고, 스캔 문서는 OCR 텍스트 추출로, 추출한 텍스트는 텍스트 정리기로 다듬고, 분량 확인은 글자수 세기로 합니다.

자주 만나는 오류

열리지 않거나 처리에 실패할 때

암호가 걸린 PDF는 먼저 암호를 풀어야 편집할 수 있습니다. 열람 암호가 아니라 권한 암호만 걸린 경우도 라이브러리가 거부할 수 있습니다.

병합 후 글자가 검색되지 않을 때

스캔한 PDF는 페이지가 이미지입니다. 병합해도 텍스트 레이어가 생기지 않으므로 검색이나 복사가 안 됩니다. 텍스트가 필요하면 OCR을 먼저 거쳐야 합니다.

파일 용량이 예상보다 클 때

병합은 각 문서의 리소스를 함께 담기 때문에 원본 합계보다 커질 수 있습니다. 같은 글꼴이 여러 번 포함되는 경우가 대표적입니다.

사용 순서와 입력 예시 더 보기

실제 입력과 결과

페이지 범위 표기

입력

1-3, 7, 10-12

결과

1, 2, 3, 7, 10, 11, 12 페이지를 순서대로 추출

페이지 번호는 1부터 셉니다. 0을 넣으면 무시되거나 오류가 납니다.

두 문서 병합 결과

입력

A.pdf (5쪽) + B.pdf (3쪽)

결과

합본 8쪽 · A의 1-5쪽 다음에 B의 1-3쪽

병합 순서는 파일을 추가한 순서를 따릅니다. 목차나 표지가 있으면 순서를 먼저 정리하세요.