AI 보안업체 Lasso가 9월 17일 실험 결과를 공개했다. AI가 쓴 글에 남기는 표식, 즉 텍스트 워터마크가 AI의 도구 선택과 유해 요청 거절 판단을 바꿀 수 있다는 내용이다. 회사가 직접 진행한 실험이다. AI가 만든 글임을 알려 주는 표식이 글의 내용뿐 아니라 스스로 일을 처리하는 AI(에이전트)의 선택에도 영향을 주는지 살폈다.
실험에 쓴 SynthID-Text는 AI가 글을 만들며 다음에 이어질 표현을 고르는 과정에 끼어들어 표식을 심는다. Lasso는 같은 질문을 넣고 워터마크를 켰을 때와 껐을 때의 결과를 비교했다. 새 기술을 내놓은 것이 아니라, 이미 쓰이는 워터마크 기술이 AI의 행동을 바꾸는지 시험한 것이다.
도구 선택은 얼마나 달라졌나
도구를 골라 쓰는 시험에서 7개 모델 중 6개의 정확도가 떨어졌다. 이 가운데 4개 모델은 통계적으로 의미 있는 하락이었다. 우연한 차이로 보기 어렵다는 뜻이다. 여기서 본 것은 사람이 읽는 문장의 자연스러움이 아니다. AI가 어떤 도구를 부를지 정할 때의 판단이다.
평균 점수보다 개별 판단이 더 크게 흔들린 사례도 있었다. phi-4는 똑같은 과제 1,150개를 풀게 했더니 판정의 16.8%가 바뀌었다. 답을 얼마나 다양하게 만들지 정하는 설정을 1.0으로 둔 조건이다. 반면 정확도 자체는 2.87%포인트만 낮아졌다. 평균만 보면 개별 선택이 얼마나 뒤바뀌었는지 드러나지 않을 수 있다.
유해한 요청을 거절하는 판단은 따로 평가했다. AI의 지시를 흔드는 공격 기법을 적용한 요청 200개를 넣었다. 그 결과 gemma-3-27b가 유해 요청에 그대로 응한 비율이 워터마크를 켠 뒤 12.5%포인트 높아졌다. 답의 다양성 설정을 0.001로 둔 조건의 결과다. 변화 정도는 모델과 워터마크에 쓰는 키에 따라 달랐다.
Claude에도 같은 일이 생길까
앤트로픽은 Claude의 텍스트 워터마크에 SynthID-Text 계열 방식을 쓴다고 밝혔다. 다만 직접 시험했을 때는 답의 내용과 읽기 편함에 영향이 없었다고 설명한다. Lasso는 Claude가 아닌 다른 모델에 SynthID-Text 설정을 적용해 도구 선택과 거절 판단을 측정했다. 이번 수치를 Claude의 성능 변화로 옮겨 읽을 근거는 없다.
실험 결과를 실제 사고와 연결할 때도 선을 그어야 한다. Lasso는 워터마크 때문에 거절 판단이 바뀐 AI가 이어서 잘못된 도구 작업까지 하는지는 확인하지 않았다. 도구 선택과 거절을 따로 시험했기 때문이다. 모든 워터마크 방식의 위험이나 실제 서비스에서 사고가 얼마나 나는지를 보여 주는 결과도 아니다.
한국에서는 무엇이 달라지나
한국은 Claude를 쓸 수 있고, 개발자가 서비스에 붙여 쓰는 방식(API)도 지원되는 지역이다. Claude 웹과 데스크톱 앱은 한국어를 지원한다. 앤트로픽은 워터마크를 지원하는 모델이라면 Claude를 쓸 수 있는 모든 지역에 표식을 적용한다고 설명한다. 반대로 그 표식을 찾아내는 탐지 기능은 아직 자격을 갖춘 기관과 일부 기업만 미리 써 보는 단계다. 글이 짧거나 많이 고쳐졌으면 탐지가 어려울 수 있다. 탐지 결과만으로 누가 어떻게 썼는지 전부 확정할 수도 없다.
이번 연구가 남긴 과제는 분명하다. AI 글을 구별하는 표식과 AI의 업무 판단을 함께 점검하는 일이다. 특히 AI에게 도구를 맡겨 쓰는 이용자라면 전체 정확도만 볼 것이 아니라 개별 선택이 바뀌는지도 따져야 한다. 앞으로는 실제 서비스 환경에서 판단 변화가 다음 작업에까지 번지는지 확인한 결과를 살펴볼 필요가 있다.
