PDF를 마크다운으로 바꾸기 (AI 토큰 줄이기)
PDF 속 글을 깔끔한 마크다운으로 뽑아서 AI 채팅이나 에이전트에 바로 붙여 넣어요. PDF는 내 기기 안에서 읽고 어디에도 올라가지 않아요.
또는 여기에 끌어 놓기
받는 형식: PDF
이 기기 안에서 변환해요. 파일이 어디에도 올라가지 않아요.
마크다운이 PDF보다 토큰을 덜 쓸 수 있는 이유
AI 서비스 상당수는 PDF를 두 번 읽어요. 글자를 뽑아 읽고, 그래프와 배치를 보려고 쪽마다 그림으로도 봐요. OpenAI와 앤트로픽 문서 모두 글과 쪽 그림을 함께 보낸다고 설명하고, 앤트로픽 문서에 따르면 글만 해도 쪽마다 보통 1,500~3,000토큰이고 여기에 그림이 더해져요.
마크다운 파일은 글만 있어서 쪽 그림 몫이 빠져요. 얼마나 줄지는 서비스와 문서마다 다르고, 늘 줄지도 않아요. 구글 제미나이 API는 PDF 한 쪽을 정해진 토큰(258토큰, 제미나이 3은 기본 약 560토큰)으로 세고 제미나이 3에서는 PDF 속 글자를 따로 세지 않아서, 거기서는 글을 붙여 넣는 쪽이 오히려 더 들 수 있어요.
이렇게 정리해 드려요
글자 크기로 제목을 찾고, 줄바꿈된 줄을 문단으로 다시 이어요(쪽이 넘어가도 이어요). 글머리표·번호 목록은 마크다운 목록이 되고, 링크는 주소가 남아요. 표는 마크다운 표로 바꿔요. 테두리가 그려진 표는 선을 따라 칸을 읽고, 테두리가 없는 표는 칸이 세로로 맞춰진 모양으로 찾아요.
논문처럼 두 단으로 된 쪽은 왼쪽 단을 다 읽고 오른쪽 단을 읽어요. 쪽마다 되풀이되는 머리말·꼬리말·쪽 번호는 빼고, 원하면 쪽이 시작하는 곳을 표시해서 "7쪽 내용"처럼 물어볼 수 있게 해요.
못 하는 것
그래프·사진·도식은 빠지고, 글자 층이 없는 스캔 쪽에서는 글이 하나도 안 나와요. 어느 쪽이 그런지 결과에 알려 드려요. 글자 인식(OCR)은 하지 않으니 스캔본은 PDF 그대로 올리거나 먼저 OCR을 거쳐 주세요.
칸을 합친 표나 머리글이 여러 줄인 표는 칸이 어긋날 수 있고, 수식은 10^20 같은 평범한 글이 돼요. 표가 중요하면 미리 보기에서 한 번 확인하고 쓰세요.
광고
자주 묻는 질문
ChatGPT나 제미나이에도 쓸 수 있나요?
네. 마크다운은 그냥 글자 파일이라 어떤 AI 채팅·에이전트·LLM에도 붙여 넣거나 .md 파일로 올릴 수 있어요. 서비스마다 다른 건 PDF를 세는 방식이라, 토큰이 줄어드는 정도도 달라요.
토큰이 얼마나 줄어요?
정해진 숫자는 없어요. 쪽마다 글과 그림을 함께 읽는 서비스(OpenAI·앤트로픽 문서에 나와요)에서는 그림 몫이 빠져요. 앤트로픽이 공개한 계산법으로 A4 한 쪽 그림은 대부분의 클로드 모델에서 최대 약 1,550토큰이에요. 반대로 쪽마다 정해진 값만 세고 글자는 공짜인 제미나이 3 API에서는 줄지 않을 수 있어요.
언제는 PDF 그대로 넣는 게 나아요?
그림에 뜻이 있을 때요. 그래프, 도표, 도면, 발표 자료, 손글씨, 스캔본, 칸 배치가 중요한 서식 같은 건 AI가 PDF나 쪽 그림을 받아야 볼 수 있어요.
PDF가 서버로 올라가나요?
아니요. 파이어폭스에 들어 있는 PDF 읽기 프로그램(PDF.js)이 이 페이지 안에서 돌아가며 내 기기에서 파일을 읽어요. 처음 변환할 때 읽기 프로그램만 이 사이트에서 받아 오고, 파일은 어디로도 보내지 않아요. 브라우저 개발자 도구의 네트워크 탭에서 확인할 수 있어요.
마이크로소프트 MarkItDown과는 뭐가 달라요?
MarkItDown은 PDF뿐 아니라 워드·파워포인트·엑셀도 바꾸는 무료 오픈소스 명령줄 도구예요. 파이썬을 깔아야 해요. 여기는 PDF만 다루는 대신 설치가 필요 없고, 쪽 모양을 보고 제목·목록·표를 살려요.
몇 쪽에서 글을 못 뽑았다고 나와요.
그 쪽은 그림이에요. 스캔했거나 종이를 찍었거나 그림으로 만든 PDF라 뽑을 글이 없어요. 그 쪽은 AI에 PDF나 그림으로 올리거나 먼저 OCR을 거쳐 주세요.
광고