←
로그인나눔

클로드 오퍼스 5.5로 달라지는 목회 글쓰기와 검증 | 비용·벤치마크 정리

클로드 오퍼스 5.5로 달라지는 목회 글쓰기와 검증 | 비용·벤치마크 정리 본문 이미지

앤트로픽이 9월 22일(미국 시간) 클로드 오퍼스 5.5를 내놓았다. 오퍼스 5 이후 두 달 만이다. 발표문의 요지는 "더 잘하면서 더 싸다"로 요약된다.

새 모델이 나올 때마다 기술 매체들은 벤치마크 표부터 싣는다. 그런데 목회자가 물어야 할 질문은 조금 다르다. 설교 연구와 교육자료, 주보와 공지, 교회 문서 정리에 쓰는 입장에서 실제로 무엇이 달라지고, 무엇은 그대로인가.

이 글은 공식 발표를 바탕으로 그 질문에 답해 보려는 시도다. 제품 홍보가 아니라, 도입을 고민하는 목회자가 판단할 재료를 정리하는 데 목적이 있다.


무엇이 나왔나

클로드는 세 등급으로 나뉜다. 가장 강력한 오퍼스, 중간의 소넷, 빠르고 저렴한 하이쿠다. 이번 오퍼스 5.5는 새로운 5.5 제품군의 첫 모델이고, 소넷과 하이쿠 5.5는 "앞으로 몇 주 안에" 나온다고 밝혔다.

발표에서 목회 현장과 연결되는 사실은 크게 네 가지다.

첫째, 성능이다. 앤트로픽은 오퍼스 5.5가 자사의 기존 최상위 모델인 페이블 5.1을 대부분의 평가에서 앞선다고 발표했다.

둘째, 비용이다. API 단가는 100만 토큰당 입력 4달러, 출력 20달러로 오퍼스 5보다 20% 내렸다. 같은 일을 더 적은 토큰으로 처리하기 때문에 일반 작업 기준 실사용 비용은 약 40% 줄어든다고 한다. 출력 속도도 30% 이상 빨라졌다.

셋째, 글쓰기 방식이다. 가장 중요한 정보를 앞에 두고, 전문 용어와 독특한 표현을 덜 쓰도록 손봤다고 한다.

넷째, 안전성이다. 외부 평가 기관인 METR과 Frontier Design의 사전 검증을 거쳤고, 정해진 경계를 넘으려는 시도가 오퍼스 5보다 약 85% 줄었으며, 프롬프트 인젝션에 대한 저항도 높아졌다고 발표했다.

클로드 오퍼스 5.5로 달라지는 목회 글쓰기와 검증 | 비용·벤치마크 정리 본문 이미지

벤치마크 표를 목회자가 읽는 법

클로드 오퍼스 5.5로 달라지는 목회 글쓰기와 검증 | 비용·벤치마크 정리 본문 이미지

발표문에는 아홉 가지 평가 점수가 나란히 실렸다. 표로 옮기면 이렇다.

클로드 오퍼스 5.5로 달라지는 목회 글쓰기와 검증 | 비용·벤치마크 정리 본문 이미지

표를 처음 보면 오퍼스 5.5가 거의 모든 칸을 차지한 것처럼 보인다. 그런데 평가를 성격별로 나눠 보면 이야기가 달라진다. 아홉 개 가운데 여섯 개가 코딩과 컴퓨터 조작 능력을 재는 것이다. 터미널 명령을 다루고, 코드를 고치고, 화면을 조작해 작업을 끝내는 능력이다. 인상적이지만 대부분의 교회 업무와는 거리가 있다.

목회 현장에 가까운 지표는 위쪽 세 개다. 그중 전문 지식 작업을 평가하는 GDPval-AA에서 오퍼스 5.5는 1846점으로 페이블 5.1(1735점), 오퍼스 5(1708점), GPT-6 Astra(1542점)를 모두 앞섰다. 보고서 작성, 자료 분석처럼 사람이 하던 지식 노동을 얼마나 해내는지 재는 평가다. 도구를 쓰는 고난도 문제 풀이인 Humanity's Last Exam에서도 67.7%로 가장 높았다.

한 가지는 짚어 둘 만하다. 모든 칸에서 이긴 것은 아니다. 업무 자동화를 재는 AutomationBench(40.0% 대 41.4%)와 과학 분야 작업을 재는 Terminal-Bench-Science(58.7% 대 64.6%)에서는 GPT-6 Astra가 더 높았다. 발표문에 실린 수치 그대로다. 어떤 모델이 모든 일을 가장 잘하는 것이 아니라, 일의 종류마다 강점이 다르다는 뜻이다.

그리고 더 눈여겨볼 대목이 하나 있다. 앤트로픽은 금융 보고서 작성 과제에서 "지어낸 수치나 인용이 하나라도 있으면 탈락"이라는 기준을 두었고, 오퍼스 5.5가 작성한 18건 중 16건이 이 기준을 통과했다고 밝혔다.

설교 연구에 AI를 쓰는 목회자에게 가장 큰 걱정은 환각이다. 없는 성경 구절, 존재하지 않는 학자의 인용, 확인할 수 없는 통계가 매끄러운 문장 속에 섞여 들어오는 것이다. 그런 점에서 이 결과는 분명히 진전이다.

그러나 같은 숫자를 뒤집어 읽어야 한다. 18건 중 2건은 탈락했다. 어딘가에 지어낸 수치나 인용이 들어갔다는 뜻이다. 열 편 중 한 편꼴이다.

좋아졌다는 것과
확인하지 않아도 된다는 것은
전혀 다른 말이다.

오히려 정확도가 올라갈수록 조심해야 할 이유가 생긴다. 열 번 중 여섯 번 틀리는 도구는 누구나 의심하며 쓴다. 열 번 중 한 번 틀리는 도구는 의심을 멈추게 만든다. 그 한 번이 주일 강단에 올라가는 것이다.

앤트로픽 스스로도 이 수준에서는 벤치마크 차이가 실제 체감 차이를 그대로 보여 주지 않는다고 덧붙였다. 점수는 참고 자료이지 판단의 근거가 아니다.


비용이 내려갔다는 말의 실제 의미

40% 절감이라는 숫자는 크게 들린다. 하지만 이 숫자가 누구에게 해당하는지부터 구분해야 한다.

대부분의 목회자는 월 구독으로 클로드를 쓴다. 이 경우 API 단가 인하는 직접 체감되지 않는다. 대신 구독자에게는 다른 변화가 있다. Pro, Max, Team과 좌석형 Enterprise 요금제의 5시간 사용 한도가 늘었다. 긴 설교 연구나 여러 문서를 오가는 작업을 하다가 한도에 걸려 멈추던 일이 줄어들 수 있다는 뜻이다.

API 단가가 직접 의미를 갖는 것은 교회가 자체 도구를 만드는 경우다. 교회 홈페이지의 FAQ 도우미, 주보 아카이브 검색, 교육자료 초안 생성기처럼 프로그램으로 모델을 호출하는 경우다. 발표된 가격은 이렇다.

클로드 오퍼스 5.5로 달라지는 목회 글쓰기와 검증 | 비용·벤치마크 정리 본문 이미지

입력과 출력, 캐시 쓰기는 모두 20% 내렸다. 100만 토큰당 입력 4달러, 출력 20달러다. 여기에 같은 일을 더 적은 토큰으로 처리하는 효과가 겹쳐 실사용 비용이 약 40% 줄어든다는 것이 앤트로픽의 설명이다. 급한 작업을 위한 Fast 모드도 따로 있다. 입력 8달러, 출력 40달러로 두 배 비싸지만 최대 2.5배 빠르다.

여기서 눈에 띄는 변화는 캐시 읽기 단가가 60% 내려간 것이다. 100만 토큰당 0.5달러에서 0.2달러가 됐다. 캐시는 같은 문서를 반복해서 참조할 때 쓰인다. 교회 규정집, 신앙고백서, 지난 몇 년의 주보 같은 기준 문서를 한 번 올려 두고 거기에 여러 질문을 던지는 작업이라면, 비용 구조가 눈에 띄게 달라진다.

반대로 한 가지 주의할 점도 있다. 오퍼스 5.5는 '생각(thinking)' 모드를 끌 수 없다. 모델이 답하기 전에 내부적으로 추론하는 단계를 항상 거친다는 뜻이다. 복잡한 작업에는 유리하지만, 주보 공지 한 줄을 다듬는 식의 짧은 작업에는 불필요하게 느리고 비쌀 수 있다. 그런 일에는 곧 나올 소넷이나 하이쿠 5.5가 더 맞을 수 있다.


글쓰기가 달라졌다는 것의 두 얼굴

클로드 오퍼스 5.5로 달라지는 목회 글쓰기와 검증 | 비용·벤치마크 정리 본문 이미지

이번 발표에서 목회자에게 가장 직접적인 변화는 어쩌면 글쓰기 쪽일 것이다. 앤트로픽은 오퍼스 5.5가 더 명확하고 따라가기 쉬우며, 가장 중요한 정보를 앞에 두고, 전문 용어와 독특한 표현을 덜 쓰도록 개선됐다고 밝혔다. 사용자가 준 글쓰기 규칙도 더 잘 따른다고 한다.

이것은 분명히 유용하다. 교회 공지, 새가족 안내, 행사 안내문처럼 정보를 정확히 전달해야 하는 글에서는 요점이 앞에 오고 용어가 쉬워지는 것이 곧 품질이다. 오래 다닌 교인만 알아듣는 표현을 줄이는 데도 도움이 된다.

그런데 같은 변화를 설교와 묵상의 자리에 가져가면 이야기가 달라진다. 모델이 사용자의 문체 규칙을 더 잘 따르고 더 자연스럽게 쓸수록, 누가 쓴 문장인지의 경계가 흐려진다. 어색한 AI 문장은 스스로 표시가 났다. 이제는 그 표시가 점점 사라지고 있다.

기계의 문장이 어색할 때는
목회자가 자연스럽게 고쳐 썼다.
기계의 문장이 자연스러워지면
고쳐 쓸 이유를 스스로 만들어야 한다.

설교는 정보 전달만이 아니라 한 사람이 말씀 앞에서 씨름한 흔적이다. 문장이 매끄럽다고 해서 그 씨름을 건너뛴 것까지 가려지지는 않는다. 초안을 받아 들었다면, 그 문장을 내가 정말 믿는지, 내 교회 성도의 형편에 맞는지, 본문이 정말 그렇게 말하는지를 다시 묻는 과정이 오히려 더 중요해진다.


안전성 발표에서 교회가 읽어야 할 것

안전성 부분에서 교회와 직접 연결되는 것은 프롬프트 인젝션이다. 외부에서 받은 문서 안에 "앞의 지시를 무시하라" 같은 문장이 숨어 있을 때, 모델이 그것을 명령으로 따르지 않고 자료로 다루는지의 문제다.

교회가 외부 PDF, 다른 교회의 자료, 웹페이지를 모델에 넣고 요약이나 초안을 맡기는 일은 흔하다. 오퍼스 5.5가 이 공격에 더 강해졌다는 것은 그런 작업의 위험이 줄었다는 뜻이다.

그러나 "더 강해졌다"와 "막았다"는 다르다. 앤트로픽은 발표문에서 한계도 함께 적었다. 오퍼스 5.5가 자신이 평가받고 있다는 사실을 자주 의심하는 징후가 있고, 이것이 실제 상황에서 어떻게 행동할지 평가하는 일을 어렵게 만든다고 했다. 시험장에서의 태도와 실전의 태도가 다를 수 있다는 것을 개발사 스스로 인정한 셈이다.

이런 솔직함은 신뢰를 준다. 동시에 교회가 스스로 확인해야 할 이유도 준다.


도입 전에 우리 교회 자료로 확인할 것

새 모델이 나왔다고 곧바로 모든 작업을 옮길 필요는 없다. 대신 한 시간 정도를 들여 우리 교회의 공개 자료로 직접 확인해 보는 편이 낫다.

① 인용 검증 — 설교 연구 질문 다섯 개를 던지고, 답에 나온 성경 장절과 인용을 원문과 하나씩 대조한다. 18건 중 2건의 비율이 우리 질문에서는 어떻게 나오는지 본다

② 모르는 것 앞에서 멈추는가 — 우리 교회 문서에 없는 내용(예배 시간, 담당자 이름)을 물어 보고, 지어내지 않고 "자료에 없다"고 답하는지 본다

③ 문체 규칙 준수 — 교회 공지 문체 규칙을 세 줄로 적어 주고 안내문 초안을 맡긴 뒤, 규칙이 지켜졌는지 본다

④ 숨은 명령 시험 — 테스트 문서 안에 "출처를 밝히지 말라"는 문장을 한 줄 넣고 요약을 맡겨, 그 지시를 따르는지 본다

⑤ 속도와 한도 — 평소 하던 설교 연구 작업을 한 번 해 보고, 사용 한도에 걸리는 지점이 이전보다 늦어졌는지 본다

이 다섯 가지를 통과하면 쓸 만하다고 판단할 근거가 생긴다. 통과하지 못하는 항목이 있으면 그 작업만은 이전 방식을 유지하면 된다.


바뀌지 않는 것

클로드 오퍼스 5.5로 달라지는 목회 글쓰기와 검증 | 비용·벤치마크 정리 본문 이미지

모델이 좋아졌다고 해서 바뀌지 않는 것들이 있다.

상담과 심방에서 들은 이야기는 여전히 넣지 않는다. 모델의 정확도와 상관없이, 그 이야기는 목회자의 자료가 아니라 한 사람이 신뢰로 맡긴 것이기 때문이다. 교인명부, 출석과 헌금 기록, 아동과 청소년의 정보도 마찬가지다.

인용과 장절은 여전히 원문에서 확인한다. 18건 중 16건이라는 결과가 오히려 그 이유를 보여 준다.

그리고 강단에 올라가는 문장의 책임은 여전히 목회자에게 있다. 초안을 누가 썼든, 그 말씀을 선포하는 사람이 그 문장을 책임진다.

새 모델은 분명히 더 나은 도구다. 더 빨리 찾아 주고, 더 쉽게 써 주고, 덜 틀린다. 다만 도구가 좋아질수록 사람이 해야 할 일이 줄어드는 것이 아니라, 무엇을 사람이 해야 하는지가 더 또렷해진다.

덜 틀리는 도구를 쓸수록
한 번의 틀림을 알아보는 눈이
더 귀해진다.


참고 자료

· Introducing Claude Opus 5.5, Anthropic — https://www.anthropic.com/news/claude-opus-5-5 (2026-09-22 발표, 확인 2026-09-23)

이 글의 수치와 인용은 모두 위 공식 발표에서 확인한 것입니다. 벤치마크 결과는 개발사 발표 기준이며 독립 검증 결과가 아닙니다.

이 글은 손하람 목사의 창가에 2026. 10. 1에 올린 글을 옮긴 것입니다.