이미지나 PDF를 여기에 놓으세요
또는 클릭해서 파일 선택 — 여러 개를 한 번에 골라도 됩니다
인식 언어
이미지나 PDF를 추가하면 읽기가 시작됩니다

이미지와 스캔 PDF에서 텍스트 추출하기

스크린샷, 책장을 찍은 사진, 스캔한 PDF를 놓으면 그 안의 글자가 선택하고 복사하고 편집할 수 있는 형태로 돌아옵니다. 인식은 브라우저 안에서 이루어지므로 파일이 기기를 벗어나지 않습니다. 여러 장을 한 번에 넣을 수 있고, PDF는 쪽 단위로 읽습니다.

이 도구가 하는 일

인쇄된 글자를 잘 읽습니다

깨끗한 스크린샷과 스캔본은 거의 그대로 읽어냅니다. 조명이 고르지 않거나 약간 기울어진 사진도 견디지만, 반듯하고 고르게 밝은 사진이 언제나 더 잘 읽힙니다.

아홉 가지 언어

영어, 중국어(간체·번체), 일본어, 한국어, 독일어, 프랑스어, 스페인어, 이탈리아어. 영어가 아닌 언어를 고르면 영어도 함께 불러옵니다. 실제 문서에는 주문번호, 이메일, 금액처럼 로마자로 적힌 것이 가득하기 때문입니다.

스캔 PDF를 쪽 단위로

PDF를 열어 한 쪽씩 읽으므로, 여러 쪽짜리 스캔본을 미리 이미지로 내보낼 필요가 없습니다.

여러 파일을 한 번에

폴더 하나 분량의 스크린샷을 놓으면 차례로 처리됩니다. 하나가 실패해도 나머지는 계속되므로, 잘못된 파일 하나가 전체를 멈추지 않습니다.

아무것도 업로드되지 않습니다

인식 엔진은 이 페이지 안에서 돌아갑니다. 이미지와 PDF가 어딘가로 전송되지 않습니다. 청구서나 계약서처럼 개인정보가 담긴 문서를 다룰 때 특히 중요한 부분입니다.

복사하거나 내려받기

결과를 바로 클립보드에 복사하거나 .txt 파일로 저장할 수 있습니다. 파일이 여러 개면 각각 이름이 붙어 결과가 섞이지 않습니다.

이미지에서 텍스트를 추출하는 방법

1

파일 추가

이미지나 PDF를 끌어다 놓거나 클릭해서 고르세요. JPG, PNG, WebP, GIF, BMP, PDF를 지원하며 파일당 50MB까지입니다.

2

언어 선택

이 페이지의 언어가 아니라 이미지 속 글자의 언어를 고르세요. 정확도에 가장 크게 영향을 주는 것이 이 설정입니다.

3

텍스트 복사 또는 내려받기

파일마다 끝나는 대로 결과가 나타납니다. 전체를 클립보드에 복사하거나 .txt로 저장하세요.

이럴 때 쓸모가 있습니다

스크린샷에 갇힌 글자

오류 메시지나 주소, 코드가 담긴 스크린샷을 받았을 때. 다시 타이핑하는 대신 글자를 꺼내 그대로 붙여 넣으면 됩니다.

검색되지 않는 스캔 문서

스캔한 계약서나 영수증은 컴퓨터가 보기엔 그림일 뿐입니다. 글자를 읽어내야 비로소 검색하고 인용할 수 있습니다.

찍어 둔 책장

책의 한 쪽, 또는 회의가 끝난 뒤의 화이트보드. 손으로 옮겨 적지 않고 내용을 되찾을 수 있습니다.

청구서와 영수증

사진을 들여다보며 한 자리씩 옮겨 적을 필요 없이 번호와 금액을 그대로 꺼냅니다.

보관하려는 오래된 서류

상자째 스캔해도 결과물은 이미지입니다. 글자를 추출해야 나중에 실제로 쓸 수 있는 자료가 됩니다.

공부 중인 외국어 자료

글자를 텍스트로 꺼내야 사전에서 찾아볼 수 있습니다. 이미지 안에 있는 동안에는 아무것도 할 수 없습니다.

더 잘 읽히게 하려면

언어부터 제대로 고르기

영향이 가장 큰 항목입니다. 영어 모델로 한국어를 읽히면 이미지가 아무리 선명해도 알아볼 수 없는 결과만 나옵니다.

글자 부분만 잘라내기

책장을 찍으면 책상이나 손, 방의 일부까지 함께 담기기 마련입니다. 종이 면만 남기면 엔진이 헷갈릴 요소가 줄어듭니다.

밝기보다 고른 조명

종이 절반에 그림자가 드리운 편이 전체적으로 조금 어두운 것보다 훨씬 나쁩니다. 더 밝게 비추기보다 빛이 고르게 드는 자리로 옮기세요.

글줄을 수평으로

비스듬히 흐르는 글자는 눈에 띄게 잘 읽히지 않습니다. 올리기 전에 사진을 반듯하게 돌리는 몇 초는 충분히 값어치를 합니다.

원본 파일 쓰기

스크린샷의 스크린샷이나 여러 앱을 거쳐 전달된 사진은 그때마다 압축됩니다. 원본이 언제나 더 선명합니다.

인쇄체는 되고 손글씨는 안 됩니다

인쇄되거나 컴퓨터로 조판된 글자를 대상으로 합니다. 손글씨 인식은 전혀 다른 문제이며, 여기서 시도하면 실망하게 됩니다.

이 도구를 쓰는 이유

문서는 계속 당신의 것

대부분의 온라인 변환 사이트는 파일을 자기 서버로 올립니다. 이 도구는 그러지 않습니다. 전부 브라우저 안에서 끝나므로 나중에 지울 것도 없습니다.

무료, 계정 불필요, 워터마크 없음

쪽수 제한도, 중간에 나타나는 가입 요구도, 결과를 보기 전의 결제 유도도 없습니다. 이 사이트는 무료이고 앞으로도 무료입니다.

한 번 받아두면 오프라인에서도

인식 엔진은 처음 내려받은 뒤 브라우저가 보관합니다. 이후로는 바로 시작되고 연결이 없어도 동작합니다.

일괄 처리와 PDF 포함

여러 이미지 일괄 처리와 여러 쪽 PDF는 무료 도구의 일부입니다. 유료 단계 뒤에 숨겨 두지 않았습니다.

한중일 처리를 대충 하지 않았습니다

인식 엔진은 보통 글자 사이마다 공백을 흩뿌려 그대로는 쓰기 어려운 결과를 냅니다. 여기서는 그 공백을 정리합니다. 다만 한글·한자와 로마자 사이의 공백은 실제로 존재하는 것이므로 남겨 둡니다.

휴대폰에서도 됩니다

전부 모바일 브라우저에서 돌아가므로 사진첩의 사진을 바로 읽을 수 있습니다.

텍스트 추출에 관한 질문

네. OCR(광학 문자 인식)은 그림 속 인쇄된 글자를 읽어내는 일을 통틀어 부르는 이름이고, 이 도구가 하는 일이 바로 그것입니다. 대부분의 OCR 사이트와 다른 점은 실행 위치입니다. 파일을 남의 서버로 올리는 대신, 엔진을 당신의 브라우저로 내려받아 돌립니다.
깨끗한 인쇄체 — 스크린샷이나 품질 좋은 스캔본 — 은 거의 그대로 읽어냅니다. 자체 테스트에서 영어 인쇄체는 완전히 정확했고 중국어 인쇄체는 약 98%였습니다. 조명이 고르지 않거나 살짝 기운 사진은 94~95% 정도입니다. 특히 숫자는 그대로 믿기보다 한 번 훑어보시길 권합니다.
읽지 못합니다. 이 점은 분명히 말씀드립니다. 이 엔진은 인쇄되거나 조판된 글자를 위한 것입니다. 손글씨 인식은 다른 모델이 필요한 별개의 문제이며, 여기서 시도하면 시간만 낭비하게 됩니다.
안 됩니다. 표 안의 글자는 읽히지만 행과 열 구조는 유지되지 않습니다. 얻는 것은 글자이지 표가 아닙니다. 엔진이 표 구조를 애초에 인식하지 않으므로 쓸 만한 엑셀로 내보낼 방법이 없습니다.
아닙니다. 인식 엔진이 브라우저로 내려와 거기서 돌아갑니다. 이미지와 PDF는 기기에서 직접 읽히며 어디로도 전송되지 않습니다. 페이지가 한 번 열린 뒤에는 도중에 연결이 끊겨도 계속 동작하는 이유가 이것입니다.
처음 쓸 때 브라우저가 인식 엔진과 언어 데이터를 내려받습니다. 모두 합쳐 약 6MB입니다. 그 뒤로는 브라우저가 보관하므로 바로 시작되고, 이미지 한 장은 1초도 걸리지 않습니다.
이 페이지의 언어가 아니라 이미지 속 글자의 언어입니다. 잘못 고르면 아무리 선명한 이미지라도 알아볼 수 없는 결과가 나옵니다. 영어가 아닌 언어를 고르면 영어도 함께 불러오므로, 주문번호나 이메일이 섞인 문서도 제대로 읽힙니다.
읽습니다. 각 쪽을 차례로 그려서 읽고 결과도 쪽 단위로 나타납니다. 아주 긴 문서는 앞의 100쪽까지만 처리하며, 그럴 때는 조용히 잘라내지 않고 알려 드립니다.
오류가 아니라 「글자를 찾지 못했습니다」라고 표시됩니다. 읽을 글자가 없는 이미지는 비정상이 아니라 정상적인 결과이기 때문입니다. 대개는 이미지가 흐리거나 글자가 너무 작거나 언어를 잘못 고른 경우입니다.
원래 없어야 하기 때문입니다. 인식 엔진은 한자 하나하나를 별개의 단어로 취급해 그 사이마다 공백을 넣고, 그 결과 그대로는 쓰기 불편해집니다. 여기서는 그 공백을 없앱니다. 다만 한자와 로마자 사이의 공백은 실제로 존재하는 것이므로 남깁니다.
있습니다. 몇 장이든 놓으면 차례를 기다리며, 끝나는 것부터 결과가 나타납니다. 하나가 실패해도 나머지는 계속되고, 도중에 멈춰도 이미 읽어낸 내용은 사라지지 않습니다.
이미지 텍스트 추출 - 사진과 스캔 PDF에서 글자 뽑기, 무료