
오래된 주보와 교육 자료가 스캔 PDF로 남아 있어도 글자를 검색할 수 없다면, 필요한 대목은 결국 한 장씩 넘겨 찾아야 한다.
이때 광학문자인식(OCR)은 사진 속 글자 모양을 기계가 다룰 수 있는 텍스트로 바꿔 준다. 거대한 대화형 AI를 먼저 도입하지 않아도, 공개 가능한 기록을 검색 가능한 문서로 정리하는 것만으로 목회 연구와 행정의 문턱을 낮출 수 있다.
다만 OCR 결과는 원문이 아니라 오류 가능성이 있는 전사본이다.
그래서 이 작업의 핵심은 "자동으로 읽었다"가 아니라
원본과 추출문을 함께 보존하고
사람이 확인할 수 있게 만드는 데 있다.
검색 가능해진다는 것의 실제 의미
스캔 PDF는 겉보기에 문서지만 기계에게는 사진 묶음이다. 그래서 "십자가"라는 단어가 백 번 나와도 한 번도 찾아지지 않는다.
여기에 텍스트 층이 더해지면 달라지는 것은 단순한 편의가 아니다.
· 삼 년 전 교육 안내에서 썼던 문구를 다시 찾을 수 있다
· 같은 주제를 언제 어떻게 다뤘는지 확인하고 중복을 줄인다
· 교회의 결정이 어떤 경과를 거쳤는지 되짚을 수 있다
기억에 의존하던 일이 자료에 근거한 일로 바뀐다. 이것이 OCR이 목회 현장에 주는 가장 현실적인 유익이다.
1. Tesseract와 OCRmyPDF가 맡는 일은 다르다

Tesseract — 글자를 추정하는 엔진
Tesseract 공식 사용자 설명서는 이 프로그램을 이미지에서 인쇄 문자를 인식하는 오픈소스 OCR 엔진으로 소개한다.
100개가 넘는 언어와 여러 출력 형식을 지원하지만, PDF 자체를 읽는 도구는 아니며 문서 구조를 그대로 재현하는 데에도 한계가 있다고 밝힌다.
한국어 자료에는 해당 언어 데이터가 필요하고, 세로쓰기·혼합 언어·옛 글꼴은 별도 확인이 필요하다.
즉 Tesseract는 "페이지의 글자를 추정하는 엔진"이지
기록의 진위를 판정하는 사서가 아니다.
OCRmyPDF — 원본 위에 텍스트 층을 얹는 도구
OCRmyPDF는 스캔 PDF의 각 페이지에 OCR 텍스트 층을 더해 검색과 복사가 가능하도록 만드는 명령행 도구다.
공식 문서에 따르면 Tesseract를 활용하고, 원래 PDF의 해상도를 유지하며, 회전 교정과 기울기 보정 같은 선택 기능을 제공한다. 여러 언어도 지정할 수 있다.
원본의 보이는 면을 두고 뒤에 검색용 문자를 얹는 방식이므로, 새 문서로 다시 타이핑하는 것보다 원본과 결과를 나란히 살피기 쉽다.
이 구조가 왜 중요한가. 다시 타이핑한 문서는 원본을 대체하지만, 텍스트 층을 얹은 PDF는 원본을 그대로 둔 채 검색만 더한다. 잘못 읽었더라도 눈에 보이는 면은 여전히 원래 페이지다.
무료라는 말의 범위
두 도구는 현재 확인 가능한 오픈소스 소프트웨어다. 원문 기준으로 Tesseract는 Apache 2.0, OCRmyPDF는 MPL-2.0 라이선스로 배포된다.
소프트웨어 사용료가 없다는 말이 설치·교육·검수·백업 비용도 없다는 뜻은 아니다.
실제로 들어가는 것은 이런 것들이다.
· 담당자가 도구를 익히고 설정을 잡는 시간
· 표본을 원본과 대조하는 검수 시간
· 원본과 결과물을 이중으로 보관할 저장 공간
· 잘못된 결과를 발견했을 때 다시 처리하는 시간
작은 교회일수록 사람의 시간이 가장 비싼 자원이므로, 이 비용을 먼저 계산하고 시작해야 한다.
또한 여기서 설명하는 기능은 공식 문서를 확인해 정리한 것이며, 특정 교회의 실제 문서 묶음으로 인식률이나 처리 시간을 직접 시험한 결과는 아니다.
2. 먼저 '읽어도 되는 기록'만 선별한다

OCR의 편리함은 검색 가능성을 높이는 데 있고, 위험도 바로 그 지점에서 생긴다.
눈으로 넘길 때는 발견하기 어려웠던 이름, 전화번호, 주소, 건강·가족 사정, 헌금이나 출석 정보가 한 번에 검색될 수 있다.
그러므로 첫 단계는 스캐너 설정이 아니라 자료 등급표다.
넣을 것과 제외할 것
이미 공개된 예배 순서, 교회가 권리를 가진 교육 안내, 공개 배포가 허용된 역사 자료처럼 비민감 문서만 별도 작업 폴더로 복사한다.
다음은 자동화 대상에서 제외한다.
· 상담 기록과 심방 메모
· 교인명부
· 아동·청소년 정보
· 재정과 인사 자료
· 회의록
과거의 공개가 현재의 재공개를 허락하지 않는다
오래된 주보가 과거에 공개됐다는 사실만으로 재배포가 자동 허용되는 것도 아니다.
당시에는 지역과 시간의 경계 안에 있던 개인 정보가 검색 가능한 디지털 자료가 되면 노출 범위가 달라진다.
1998년 주보에 실린 한 줄은 그해 그 예배당에 온 사람들만 보았다. 같은 줄이 검색되는 순간, 이름만 넣으면 삼십 년 전 사정이 낯선 사람 앞에 펼쳐진다. 정보는 그대로인데 맥락이 사라진 것이다.
사람 이름이 역사 기록에 꼭 필요하다면 공개 목적, 동의나 법적 근거, 보존 기간을 책임자가 먼저 판단해야 한다.
로컬이라고 안전한 것이 아니다
외부 클라우드 OCR에 올릴 계획이라면 전송 위치, 보존 정책, 학습 이용 여부도 따로 확인한다.
판단이 서지 않으면 로컬 도구를 쓰는 것으로 타협하지 말고 그 문서를 제외한다.
로컬 처리 역시 공유 폴더, 자동 백업, 악성코드, 계정 권한의 위험을 없애지 못한다.
어디서 처리했는가보다
무엇을 넣었는가가 먼저다.
3. 한 묶음을 처리하는 일곱 단계

원본을 보존한다 — 읽기 전용 사본으로 두고 파일의 해시와 페이지 수를 기록한다
2. 작업 목록을 만든다 — 공개 가능성·저작권·개인정보를 확인한 목록을 먼저 만든다
3. 대표 표본을 고른다 — 5~10쪽. 선명한 페이지뿐 아니라 기울어진 면, 작은 글씨, 표, 얼룩, 한글과 영문이 섞인 면을 포함해야 실패 양상이 드러난다
4. 별도 파일로 출력한다 — OCRmyPDF에서 한국어와 필요한 보조 언어를 명시하고, 원본 파일 위에 덮어쓰지 않는다
5. 표본 검수표를 만든다 — 틀리면 의미가 크게 바뀌는 항목을 원본과 대조한다
6. 기준을 넘으면 되돌린다 — 오류가 허용 기준을 넘으면 해상도나 언어 설정을 조정해 다시 처리하고, 개선되지 않으면 자동 전사를 중단한다
7. 승인본을 연결한다 — 원본 이미지, 검색 가능한 PDF, 검수 기록을 함께 두되 각각의 역할을 표시한다
옵션을 많이 켜는 것이 능사가 아니다
회전·기울기 보정은 표본에서만 켜 보고, 글자나 도형이 훼손되지 않는지 눈으로 비교한다.
Tesseract의 품질 개선 문서는 해상도, 이진화, 잡음 제거, 기울기, 테두리, 페이지 분할 방식이 결과에 영향을 줄 수 있다고 설명한다.
한 번에 여러 옵션을 바꾸면 무엇이 효과를 냈는지 알 수 없다. 실패 페이지의 원인을 보고 하나씩 바꾸는 편이 안전하다.
한국어 자료에서 특히 어려운 것들
우리 교회 문서에는 영어권 사례에 없는 어려움이 섞여 있다.
· 세로쓰기 — 오래된 주보와 기념 문집에 흔하다. 가로 기준으로 읽으면 글자 순서가 뒤엉킨다
· 국한문 혼용 — 한자가 섞인 옛 문서는 언어 설정을 한국어만으로 두면 인식이 무너진다
· 옛 활자와 등사본 — 잉크 번짐과 불균일한 농도가 많다
· 손글씨 — 인쇄 문자 인식 엔진의 범위 밖이다. 자동 처리 대상이 아니다
이 유형은 처음부터 '확인 필요' 묶음으로 분리하는 편이 낫다. 되는 것과 안 되는 것을 먼저 갈라 두면 검수 부담이 크게 줄어든다.
검수표에 반드시 넣을 고위험 항목
문서마다 틀리면 의미가 크게 바뀌는 항목을 원본과 대조한다.
· 제목과 날짜
· 성경 장절
· 고유명사(인명·지명·기관명)
· 숫자(금액·인원·시각)
· 부정어
· 표의 머리글
"사랑"이 "사량"으로 바뀌는 오자보다 "않다"의 '않'이 빠지는 오류가 더 위험할 수 있다. 전자는 읽자마자 이상하지만, 후자는 문장이 멀쩡해 보이면서 뜻이 정반대가 된다.
검색이 된다는 이유로
전 문장이 정확하다고 간주하지 않는다.
인용할 때는 반드시 원본으로 돌아간다
검색 결과에서 발견한 문장을 설교나 교육 자료에 쓸 때는 반드시 원본 페이지를 다시 열어 문맥과 철자를 확인한다.
OCR 텍스트만 생성형 AI에 넣어 요약하면 인식 오류가 자연스러운 문장으로 매끈하게 확대될 수 있다.
이 과정은 생각보다 조용히 일어난다. OCR이 한 글자를 잘못 읽고, 모델이 그 어색함을 문맥에 맞게 다듬고, 다듬어진 문장이 원래 그랬던 것처럼 보인다. 오류의 흔적이 지워지는 것이 가장 위험한 부분이다.
AI 요약은 발견을 돕는 임시 색인으로만 사용하고, 인용·교리 설명·날짜와 수치는 원본을 기준으로 사람이 최종 확인한다.
처리 기록을 남긴다
작업 명령과 설정도 문서 묶음마다 남긴다.
· 사용한 도구 버전
· 언어 조합
· 회전·기울기 보정 여부
· 입력과 출력 파일 이름
· 실행 날짜
짧은 처리 기록만 있어도 나중에 같은 결과를 재현하거나 잘못된 설정의 범위를 찾기 쉽다. "작년에 처리한 것 중 어디까지 다시 봐야 하는가"에 답할 수 있게 된다.
반대로 전체 파일 경로나 명령 로그에 개인 이름이 섞일 수 있다면 공개 보고서에 그대로 붙이지 않는다. 기술 기록도 최소한으로 수집하고 접근 권한과 삭제 시점을 정해야 한다.
시작이 부담스럽다면
전체 아카이브를 떠올리면 시작할 수 없다. 첫 묶음은 공개가 확실한 문서 열 쪽이면 충분하다.
열 쪽을 끝까지 통과시켜 보면 이 교회의 자료에서 무엇이 잘 읽히고 무엇이 막히는지 알게 된다. 그 경험이 다음 백 쪽의 설계가 된다.
4. 정확도보다 '오류를 찾을 수 있는 구조'를 평가한다
시험 운영의 성과를 처리한 페이지 수로만 계산하면 검수가 방해물처럼 보인다.
더 나은 지표는 이런 것들이다.
· 표본에서 발견된 중대 오류
· 원본 페이지로 돌아가는 데 걸린 시간
· 재처리 비율
· 개인정보 때문에 제외한 문서 수
· 검색 결과가 실제 연구 질문에 도움을 준 횟수
무작위 페이지뿐 아니라 숫자와 고유명사가 많은 고위험 페이지를 따로 뽑아야 한다.
손글씨, 세로쓰기, 오래된 활자, 저해상도 복사본처럼 도구가 약한 유형은 "확인 필요" 꼬리표를 붙이고 자동 완성 목록에서 뺀다.
운영 권한을 작게 나눈다
· 한 사람은 대상 자료의 공개 가능성을 승인한다
· 다른 사람은 기술 처리를 한다
· 내용 책임자는 표본과 실제 인용을 검수한다
한 사람이 셋을 다 하면 판단이 흐려진다. 공개해도 되는지 스스로 정하고 스스로 처리하고 스스로 검수하면, 실수를 발견할 사람이 남지 않는다.
고칠 때는 흔적을 남긴다
오류 신고를 받으면 검색본을 조용히 교체하지 말고 수정 일자와 이유를 남긴다.
원본은 변하지 않았는지 해시로 다시 확인하고, 검색본에는 이런 표지를 둔다.
OCR 전사에는 오류가 있을 수 있으며
인용은 원본 대조가 필요함
보존 기간이 끝난 임시 이미지와 로그의 삭제 책임자도 정한다.
생성형 AI를 더한다면 역할은 더 좁아진다
공개가 승인된 OCR 텍스트에서 주제 후보나 검색어를 제안하게 할 수는 있다.
그러나 사실을 복원하거나 누락된 글자를 상상하게 해서는 안 된다.
목회자의 설교 책임, 기록 관리자의 판단, 공동체의 기억을 모델에 넘길 수 없다. 저작권이 불분명한 책이나 성경 번역문을 대량 입력하지 않고, 편향된 표현과 잘못 인식된 인명이 결과에 반복되는지도 점검한다.
시작 전 한 장짜리 점검표

자료
· 넣는 문서가 전부 공개 승인된 것인가
· 과거의 공개가 오늘의 검색 공개까지 포함한다고 볼 수 있는가
· 제외한 문서의 목록이 따로 남아 있는가
처리
· 원본을 덮어쓰지 않고 별도 파일로 출력했는가
· 표본에 실패하기 쉬운 페이지를 포함했는가
· 도구 버전·언어 설정·실행 날짜를 기록했는가
검수
· 날짜·장절·고유명사·숫자·부정어를 원본과 대조했는가
· 잘 안 되는 유형에 '확인 필요' 표시를 붙였는가
· 검색본에 전사 오류 가능성 표지를 달았는가
책임
· 승인·처리·검수를 다른 사람이 맡았는가
· 오류 신고 창구와 수정 이력 기록 방식이 정해졌는가
· 임시 이미지와 로그의 삭제 책임자와 시점이 정해졌는가
결론: 더 많이 읽게 하는 기술보다 다시 확인하게 하는 기술
OCR은 낡은 종이를 새 지식으로 바꾸는 마법이 아니다. 공개 가능한 스캔 기록에 검색용 텍스트 층을 더해 필요한 페이지를 빨리 찾도록 돕는 기술이다.
좋은 도입은 이렇게 한다.
· 원본을 덮어쓰지 않는다
· 민감 문서를 먼저 제외한다
· 대표 표본에서 실패를 확인한다
· 중요한 문장은 원본으로 되돌아가게 만든다
Tesseract와 OCRmyPDF의 가치는 목회자를 대신해 기록의 뜻을 결정하는 데 있지 않다.
사람이 오래된 자료를 더 책임 있게 발견하고,
잘못 읽은 글자를 고치고,
실제 맥락을 다시 살피도록 돕는 데 있다.
참고 자료
· Tesseract User Manual, tessdoc — https://tesseract-ocr.github.io/tessdoc/ (확인 2026-09-21)
· Tips to Improve Recognition, tessdoc — https://tesseract-ocr.github.io/tessdoc/ImproveQuality.html (확인 2026-09-21)
· OCRmyPDF Documentation — https://ocrmypdf.readthedocs.io/en/latest/ (확인 2026-09-21)
라이선스 표기(Tesseract Apache 2.0, OCRmyPDF MPL-2.0)는 각 프로젝트 저장소에서 도입 시점에 다시 확인하시기 바랍니다.
이 글은 손하람 목사의 창가에 2026. 9. 21에 올린 글을 옮긴 것입니다.