오늘의 질문

직역투 없이 자연스럽게 번역하려면 어떤 AI를 쓰면 될까. 관용구, 업무 메일, 드라마 자막을 비교한 이번 시험에서는 GPT-6 Astra가 평균 9.3점으로 가장 높았다. 짧은 자막에서는 가벼운 GPT-6 Luna도 같은 점수를 받았다. 용도에 따라 답이 달라진 셈이다.

번역은 뜻을 알아보는 데서 끝나지 않는다. 거래처에 그대로 보낼 메일이나 한국인이 실제로 말할 법한 대사가 필요하다. 이번에는 뜻을 살리면서 말투와 길이까지 요청에 맞추는지 봤다.

이렇게 시험했다

2026년 9월 24일, 여섯 모델에 같은 프롬프트(AI에게 주는 지시문)를 넣었다. 앤트로픽의 Claude Opus 5.5와 오픈AI의 GPT-6 Astra는 각 회사의 상위 모델이다. xAI의 Grok 4.5는 이전 세대 상위 모델이다. Claude Haiku 4.5, GPT-6 Luna, 구글의 Gemini 3.5 Flash는 가벼운 모델로 비교했다. 모두 기본 설정에서 문제마다 한 번씩 실행했다.

채점은 Claude Opus 5와 GPT-6 Sol이 맡았다. 두 모델은 어느 AI가 쓴 답인지 모르는 상태에서 1~10점을 매겼다. 채점을 맡은 Claude Opus 5와 비교 대상인 Claude Opus 5.5는 다른 모델이다. 이번 세 문제는 정답이 하나로 정해지지 않았다. 그래서 맞힌 개수 대신 번역의 질과 요청을 지켰는지를 점수로 봤다.

Gemini 3.5 Flash와 Grok 4.5는 GitHub Copilot으로 실행했다. 모델마다 짧은 확인 응답에 걸린 시간을 먼저 재고, 이를 문제 응답 시간에서 뺐다. 준비 시간을 뺐어도 실행 경로가 달라 응답 속도를 그대로 비교하기는 어렵다.

문제 1: 관용구를 한국어답게

영어 비유를 글자 그대로 옮기지 않고 한국어다운 표현으로 바꾸는지 봤다.

다음 영어 문장을 자연스러운 한국어로 번역해 줘. 직역하지 말고 한국 사람이 실제로 쓰는 말로.

"Let's not reinvent the wheel here — the old process works, it just needs a fresh coat of paint."

GPT-6 Astra가 9.5점, Grok 4.5가 9.0점으로 높았다. 두 모델 모두 기존 방식을 버리지 말고 조금만 다듬자는 뜻을 짧게 전달했다. 특히 Grok 4.5의 “겉만 좀 손보면 돼"는 가볍게 고친다는 느낌을 잘 살렸다는 평가를 받았다. 응답 시간은 GPT-6 Astra가 1.2초, Grok 4.5가 2.4초였다.

GPT-6 Luna는 8.0점이었다. 뜻은 자연스럽게 전달했지만 일부 어순과 단어가 아쉽다는 지적을 받았다. Claude Haiku 4.5는 첫 문장에 “바퀴를 다시 만들"이라는 직역을 남겨 5.0점에 그쳤다. 뒤에 자연스러운 대안을 붙였어도 첫 번역의 문제를 덮지 못했다.

Claude Opus 5.5와 Gemini 3.5 Flash는 각각 7.5점이었다. Claude Opus 5.5는 번역보다 여러 대안과 해설을 덧붙인 점이 감점 요인이었다. Gemini 3.5 Flash는 문장 끝 말투가 섞였다는 평가와 자연스럽다는 평가가 갈렸다. 채점 점수도 6점과 9점으로 나뉘었다.

문제 1에 대한 모델별 실제 답 (2026년 9월 24일 실행, 앞부분만)

문제 1에 대한 모델별 실제 답 (2026년 9월 24일 실행, 앞부분만)

문제 2: 거래처에 보낼 메일

한국어 부탁의 공손함을 살리면서 기한과 이유를 영어 메일에 분명히 담는지 봤다.

다음 내용을 해외 거래처에 보낼 짧은 영어 메일로 써 줘. 공손하지만 분명하게.

"지난주에 요청드린 견적서를 아직 받지 못했습니다. 이번 주 금요일까지 보내주실 수 있을까요? 내부 보고 일정이 있어서요."

GPT-6 Astra가 9.5점으로 다시 1위였다. 견적서를 받지 못한 상황, 금요일까지라는 기한, 내부 보고라는 이유를 모두 담고 감사 인사로 마무리했다. Gemini 3.5 Flash도 9.0점으로 바짝 따라붙었다. 응답 시간은 각각 2.3초와 1.1초였다.

이 문제에서는 원문에 없는 사실을 보태지 않는 것도 중요했다. Claude Opus 5.5는 보고가 다음 주 초로 잡혔다는 내용을 더해 7.0점을 받았다. Claude Haiku 4.5는 설명과 대안까지 붙여 짧은 메일을 원한 요청보다 길어졌고, 6.5점에 머물렀다.

GPT-6 Luna는 1.6초 만에 간결한 메일을 썼다. 다만 공손함을 두고 채점 점수가 6점과 9점으로 갈려 평균 7.5점이었다. Grok 4.5는 거래처에 쓰기 어색한 호칭과 마무리가 지적돼 7.0점을 받았다. 응답에 26.1초가 걸렸지만 오래 기다린 만큼 좋은 결과로 이어지지는 않았다.

문제 2에 대한 모델별 실제 답 (2026년 9월 24일 실행, 앞부분만)

문제 2에 대한 모델별 실제 답 (2026년 9월 24일 실행, 앞부분만)

문제 3: 신입의 첫인사 자막

영어의 편한 말투를 그대로 따라가지 않고, 처음 만난 부장에게 맞는 존댓말을 고르는지 봤다.

드라마 자막 작업이다. 신입 사원이 처음 만난 부장에게 하는 말로 자연스럽게 번역해 줘.

"Hey, nice to meet you. I'm the new guy. Just tell me what to do."

GPT-6 Astra와 GPT-6 Luna가 나란히 9.0점을 받았다. 두 답변 모두 “시키실 일 있으면 말씀해 주세요"로 용건을 전했다. 처음 만난 상사에게 어울리는 말투인 데다, 군더더기 설명 없이 바로 자막으로 쓸 수 있다는 평가였다. 응답 시간은 Astra가 4.8초, Luna가 1.6초로 가벼운 모델이 더 빨랐다.

Grok 4.5는 짧고 자연스러웠다. 다만 할 일을 알려 달라는 말을 지시에 따르겠다는 다짐으로 바꿔 7.5점을 받았다. Gemini 3.5 Flash는 “지시만 내려 주십시오"가 지나치게 딱딱하다는 평가로 6.0점이었다. 존댓말을 높인다고 자연스러운 자막이 되지는 않았다.

Claude Opus 5.5는 6.5점, Claude Haiku 4.5는 5.5점이었다. 두 모델 모두 여러 번역과 설명을 내놓아 자막 요청에 비해 장황하다는 지적을 받았다. Claude Opus 5.5가 제시한 대안은 실무에 쓸 만하다는 평가와 말투가 상황에 맞지 않는다는 평가로 갈렸다.

문제 3에 대한 모델별 실제 답 (2026년 9월 24일 실행, 앞부분만)

문제 3에 대한 모델별 실제 답 (2026년 9월 24일 실행, 앞부분만)

라운드 성적표

모델평균 심사 점수정답평균 응답 시간출력 속도(초당 글자)
GPT-6 Astra9.3점0/02.8초60
GPT-6 Luna8.2점0/01.6초62
Grok 4.57.8점0/011.2초13
Gemini 3.5 Flash7.5점0/02.6초125
Claude Opus 5.57.0점0/03.7초130
Claude Haiku 4.55.7점0/05.3초97

응답 시간은 준비 시간을 뺀 값이다. 실행 경로가 달라 참고용으로만 봐야 한다.

정답 0/0은 모두 틀렸다는 뜻이 아니다. 이번 세 문제에는 맞고 틀림을 가릴 정답 자체가 없었다. 출력 속도도 답변의 쓸모와 함께 봐야 한다. Claude Opus 5.5는 초당 쓰는 글자가 가장 많았지만, 요청하지 않은 설명까지 길게 붙였다.

그래서 뭘 쓰면 될까

바로 쓸 수 있는 문장을 받고 싶다면 GPT-6 Astra가 이번 시험에서 가장 안정적이었다. 세 문제 모두 9점 이상이었고, 평균 응답 시간도 2.8초였다.

빨리 답이 필요할 땐 GPT-6 Luna를 고려할 만하다. 평균 1.6초에 8.2점을 받았고, 자막에서는 Astra와 같은 점수였다. 짧은 대사에는 가벼운 모델로도 충분했다. 다만 거래처 메일의 공손함은 따로 확인하는 편이 낫다.

영어 업무 메일이 목적이라면 Gemini 3.5 Flash도 후보다. 해당 문제에서 9.0점을 1.1초 만에 받았다. 상위 모델을 고른다고 늘 더 나은 번역이 나오지는 않았다. 이번에는 가격을 비교하지 않아 비용 대비 가치까지 판단하기는 어렵다.

지금까지 누적 순위

순위모델5개 라운드 평균 심사 점수정답평균 응답 시간
1GPT-6 Astra9.2점8/82.4초
공동 2Grok 4.58.5점8/85.0초
공동 2Gemini 3.5 Flash8.5점8/82.6초
공동 2Claude Opus 5.58.5점8/82.1초
5GPT-6 Luna7.7점6/81.2초
6Claude Haiku 4.56.6점8/85.1초

공동 순위는 표에 적힌 평균 점수 기준이다. 누적 정답 수에는 앞선 라운드에서 정답을 가린 문제만 들어간다.

이번 비교의 한계

이번 비교는 세 문제를 각각 한 번씩만 실행한 결과다. AI가 매긴 점수도 참고 값이다. 어떤 말투가 자연스러운지를 두고 채점 모델끼리도 평가가 갈렸다. 그래도 짧고 용도가 분명한 번역이라면 가벼운 모델로도 충분할 수 있다는 점은 확인됐다. 같은 요청을 여러 번 하거나 더 긴 글을 맡겼을 때도 이 차이가 그대로일지는 다음에 살펴볼 부분이다.

모델 비교번역GPT-6 AstraGPT-6 LunaGemini 3.5 Flash