PDF 텍스트 추출(무료・문자 기반 PDF 본문 복사와 .txt 저장)

PDF 안에 담긴 문자 정보를 그대로 일반 텍스트로 추출하는 무료 도구입니다. 업로드 없이 브라우저 안에서 모든 처리가 완료되며, 추출한 본문은 클릭 한 번으로 복사하거나 .txt 파일로 다운로드할 수 있습니다.

PDF 텍스트 추출이란

PDF 텍스트 추출이란 PDF 파일 안에 내장된 문자 정보를 복사・붙여넣기와 검색이 가능한 일반 텍스트로 꺼내는 작업을 말합니다. 계약서나 논문, 보고서를 PDF로 받았지만 본문만 따로 문서나 메모에 옮기고 싶을 때, 또는 번역 도구나 AI 챗봇에 붙여넣어 요약을 맡기고 싶을 때 주로 사용됩니다.

이 도구는 PDF 내부에 저장된 문자의 좌표 데이터를 읽어 들여, 줄과 단어의 경계를 판단하면서 일반 텍스트 형태로 재구성합니다. 처리는 모두 사용 중인 기기 안에서 완결되므로 PDF의 내용이 서버로 전송되는 일은 없습니다. 다만 처리할 수 있는 것은 애초에 문자 데이터로 만들어진 PDF(Word나 파워포인트 등에서 내보낸 문서, 웹페이지를 PDF로 저장한 문서 등)에 한정되며, 종이 문서를 스캔하기만 한 이미지 PDF에서는 문자를 추출할 수 없습니다.

PDF에서 텍스트를 추출하는 방법

  1. PDF를 선택합니다 영역 안으로 드래그 앤 드롭하거나 클릭하여 파일을 선택합니다.
  2. 자동으로 추출이 시작됩니다 파일을 선택하는 즉시 페이지 순서대로 텍스트 추출이 시작됩니다.
  3. 추출 결과를 확인합니다 화면 아래 텍스트 영역에 모든 페이지의 본문이 이어서 표시됩니다.
  4. 복사하거나 저장합니다 「텍스트 복사」로 클립보드에 담거나, 「.txt로 다운로드」로 파일로 저장할 수 있습니다.

더 잘 활용하기 위한 팁

  • 추출 결과의 줄바꿈 위치는 원본 PDF의 레이아웃(단 구성이나 표)에 영향을 받을 수 있습니다. 2단 구성 자료에서는 줄 중간에 의미가 뒤바뀌는 경우가 있으므로, 추출 후에는 한 번 훑어보며 확인해 주세요.
  • 종이 문서를 스캔하기만 한 이미지 PDF는 문자 데이터를 가지고 있지 않아 이 도구로는 추출할 수 없습니다. 이 경우에는 광학 문자 인식(OCR)을 지원하는 별도의 도구가 필요합니다.
  • 제목이나 굵은 글씨 같은 서식 정보는 유지되지 않습니다. 서식까지 그대로 옮기고 싶다면 문서 변환 계열 도구를 검토해 보세요.
  • 추출하기 전에 페이지를 추리거나 순서를 바꾸고 싶다면, PDF 페이지 정리 도구를 먼저 사용하면 효율적입니다.
  • 반대로 PDF 페이지를 이미지로 저장하고 싶다면 PDF→이미지 변환을 이용해 주세요.

PDF 텍스트 추출 활용 사례

논문이나 보고서의 본문을 인용하고 싶을 때

PDF 상태로는 선택하기 번거로운 본문도 텍스트로 바꾸면 필요한 문단만 골라 복사해 인용할 수 있습니다.

번역 도구나 AI 챗봇에 읽히고 싶을 때

PDF를 직접 다루지 못하는 도구라도, 추출한 일반 텍스트라면 붙여넣어 요약이나 번역을 맡길 수 있습니다.

계약서 내용을 키워드로 검색하고 싶을 때

.txt 파일로 저장해 두면 텍스트 편집기의 검색 기능으로 원하는 조항을 바로 찾을 수 있습니다.

오래된 PDF의 내용을 다른 문서로 옮기고 싶을 때

스캔이 아니라 문자 기반으로 만들어진 옛 자료라면, 본문만 새로운 문서 형식으로 손쉽게 옮길 수 있습니다.

PDF 텍스트 추출 관련 용어

텍스트 기반 PDF
Word나 파워포인트 등에서 내보낸, 문자가 좌표 데이터로 저장된 PDF입니다. 이 도구는 이 종류의 PDF에만 대응합니다.
이미지 기반 PDF(스캔 PDF)
종이 문서를 스캐너나 카메라로 촬영해 만든 PDF로, 겉보기에는 글자지만 실제로는 한 장의 이미지입니다. 문자 데이터가 없기 때문에 이 도구로는 추출할 수 없습니다.
OCR(광학 문자 인식)
이미지 속에 있는 글자의 모양을 인식하여 텍스트 데이터로 바꾸는 기술입니다. 이미지 기반 PDF에서 문자를 꺼내려면 OCR이 필요합니다.
일반 텍스트(순수 텍스트)
색상이나 굵기, 글꼴 같은 서식을 전혀 가지지 않는, 문자 그 자체만으로 이루어진 데이터입니다. 이 도구가 출력하는 형식이 바로 이것입니다.
.txt 파일
확장자가 「.txt」인 일반 텍스트 파일입니다. 거의 모든 운영체제와 앱에서 열 수 있어 범용적인 저장 형식으로 쓰입니다.

자주 묻는 질문

애초에 업로드되지 않습니다. PDF를 읽어 들이는 과정도 텍스트를 추출하는 과정도 모두 사용 중인 브라우저 안에서 이루어지며, 파일 내용이 네트워크로 전송되는 일은 전혀 없습니다.

불가능합니다. 스캔한 문서는 겉보기에는 글자처럼 보여도 데이터상으로는 한 장의 이미지이며, 이 도구가 읽어 들이는 문자 좌표 정보를 가지고 있지 않습니다. 이런 PDF에는 OCR(광학 문자 인식)을 지원하는 별도의 도구가 필요합니다.

PDF는 「이 위치에 이 글자를 놓는다」라는 좌표 정보의 모음일 뿐, Word처럼 뚜렷한 문단 구조를 가지고 있지 않습니다. 표나 단 구성이 있는 자료에서는 원래의 읽는 순서와 추출 순서가 일치하지 않을 수 있습니다.

열 때 비밀번호가 필요한 PDF는 읽을 수 없습니다. 미리 비밀번호를 해제한 파일을 준비해 주세요.

이 도구는 한 번에 한 파일씩 처리하도록 되어 있습니다. 여러 PDF를 다루고 싶다면 파일을 다시 선택해 반복해서 이용해 주세요.
툴군

여담 ― PDF 안에 「문자」는 어떻게 저장되어 있을까

PDF를 열면 글자가 또렷하게 보이기 때문에 내부에도 「문장」이 그대로 저장되어 있을 것 같지만, 실제로는 그렇지 않습니다. PDF 내부에는 인쇄 업계에서 오랫동안 쓰여 온 PostScript라는 언어의 개념을 이어받아, 「이 글꼴의 이 글자를, 페이지의 이 좌표에 놓는다」라는 그리기 명령이 끝없이 나열되어 있습니다. 문단이나 페이지라는 단위조차 없고, 있는 것은 한 글자씩의 위치 정보뿐입니다.

이 도구가 하는 일은 이러한 좌표 정보의 모음에서 원래 문장의 순서를 추측하여 다시 조립하는 작업입니다. 같은 높이(y좌표)에 늘어선 글자를 하나의 줄로 간주하고, 줄이 끊기는 지점을 판단해 이어 붙임으로써 사람이 읽을 수 있는 일반 텍스트로 재구성합니다. 잡지 기사처럼 2단으로 구성되어 눈으로 볼 때는 자연스러워 보여도 좌표가 늘어선 순서가 복잡한 자료에서는, 이 추측이 어긋나 줄 중간에 의미가 뒤바뀌어 버리는 경우도 있습니다.

이런 구조를 알아 두면 「PDF에서 복사・붙여넣기를 하면 왜 자주 흐트러질까」라는 소박한 의문도 이해가 됩니다. Word나 웹페이지처럼 처음부터 문단・제목・표 같은 구조 정보를 가진 문서와 달리, PDF는 기본적으로 「보이는 그대로를 재현하는 것」만을 목적으로 설계된 형식입니다. 글자의 나열에서 의미를 읽어 내는 처리는 어디까지나 나중에 덧붙인 추측일 뿐입니다. 추출 결과를 확인할 때는 이러한 특성을 염두에 두고 한 번 훑어보시길 권해 드립니다.