필드 노트

같은 질문, 다른 어시스턴트

2026-07-254 min read한국어AIDesignTrust

다국어 어시스턴트는 답변의 언어만 바꾸지 않는다. 반박하고, 안심시키고, 설명하고, 의심을 인정하는 태도까지 달라질 수 있다.

AI 번역 초안

OpenAI Codex을 사용해 2026-07-26에 한국어 번역을 생성했습니다. 초안의 흔적은 번역 과정에서 내려진 선택을 보여 줍니다. 신뢰도 점수가 아니라 검토를 위한 손잡이입니다.

두 사람이 같은 어시스턴트에게 같은 사업 계획을 검토해 달라고 해도, 서로 다른 언어로 질문했다는 이유만으로 계획의 품질에 대해 다른 인상을 갖고 돌아갈 수 있다.

현지화 워크숍에서 만든 가정이 아니다. Anthropic이 새로 발표한 모델과 언어에 따른 Claude의 가치 성향 연구에 나온 사례다. 연구진은 영어에서 Claude가 주의, 엄밀함, 깊이, 솔직함 쪽으로 더 기울었다고 밝혔다. 아랍어에서는 따뜻함, 공손함, 간결함, 실행 쪽으로 더 기울었다. 스무 개 언어를 통틀어 가장 큰 차이는 어시스턴트가 따뜻함과 엄밀함 중 어느 쪽을, 솔직함과 과업 완수 중 어느 쪽을 얼마나 강조하는지에서 나타났다.

중요한 단어는 표현된이다. 이 연구는 모델이 가치관을 지녔다거나, 영어 화자가 본래 엄밀하다거나, 아랍어 화자가 공손한 대우를 원한다고 주장하지 않는다. 대화의 과업과 주제, 사용자가 표현한 가치를 통제한 뒤 모델 행동의 패턴을 측정했다. 네 축이 설명하는 것은 차이의 일부일 뿐이며, 연구진은 그 차이가 학습 데이터, 후속 학습, 불균등한 언어 자원, 대화 규범에 대한 적절한 적응에서 각각 얼마나 비롯되는지 아직 알지 못한다.

그래도 이 결과는 익숙한 제품 문제의 모양을 바꾼다.

다국어 어시스턴트는 같은 지능을 다른 말에 담기만 하는 것이 아니다. 언어가 행동 구성의 일부가 될 수 있다.개념 압축번역: 언어가 행동 구성의 일부가 될 수 있다.행동 구성은 언어가 고정된 답변의 표현만 바꾸는 것이 아니라 행동을 바꾸는 설정이 될 수 있다는 기술적 의미를 살렸습니다.대안: 언어는 행동 설정처럼 작동할 수 있다 시스템이 전제에 이의를 제기하고, 근거를 요구하고, 위험을 경고하고, 불확실성을 인정하고, 위로를 건네거나 그저 요청을 완료하는 적극성이 달라질 수 있다. 번역은 정확한데 관계는 달라질 수 있다.

나는 Draft Marks for Translation을 만들며 이 문제를 생각해 왔다. 하나의 영어 원문을 정본으로 유지하면서 결과에 영향을 주는 번역 선택을 드러내는 실험이다. 이 작업에는 다국어 출판에 필요한 일반적인 장치가 있다. 언어 태그, 오른쪽에서 왼쪽으로 읽는 레이아웃, 문자 체계를 고려한 읽기 시간, 원문 정렬, 검토 상태다. 번역 표현이 아직 확정되지 않았더라도 원문은 비교할 만큼 안정적이라고 가정한다.

어시스턴트는 그 가정을 복잡하게 만든다. 언어들 아래에 번역되기를 기다리는 안정된 답변이 존재하지 않을 수 있다. 요청의 언어가 어떤 답변이 만들어지는지 자체를 바꿀 수 있다.

제품 검토에서는 이를 놓치기 쉽다. 팀은 열두 개 언어로 어시스턴트를 출시하고 인터페이스가 맞는지, 문장 부호가 제대로 작동하는지, 안전 거부가 계속 작동하는지, 벤치마크 점수가 준수한지 확인한다. 원어민이 번역을 검토한다. 누군가 독일어에서 놀랄 만큼 격식 있어진 버튼을 찾아낸다. 출시는 계속된다.

하지만 더 깊은 시험은 단어들이 대략 같은 뜻인지가 아니다. 어시스턴트가 같은 역할을 맡는지다.관계적 은유번역: 어시스턴트가 같은 역할을 맡는지다.같은 역할을 맡다는 순간의 연기가 아니라 지속되는 사회적 위치라는 뜻을 유지합니다.대안: 어시스턴트가 같은 기능을 수행한다

취약한 계획에 똑같이 강하게 이의를 제기하는가? 중요한 조언을 하기 전에 의심을 밝히는가? 한 언어에서는 더 맞장구치고 다른 언어에서는 더 많이 바로잡는가? “간결하게 답해 줘”라는 말이 영어로 검토했다면 받았을 주의 사항을 조용히 지우는가? 누군가 일, 돈, 건강, 갈등에 관해 물을 때 따뜻함과 엄밀함의 차이는 장식이 아니다. 그 차이는 사용자가 시스템이 무엇을 승인했다고 믿는지를 바꿀 수 있다.

그렇다고 모든 언어가 하나의 평평하고 문화적 고향이 없는 어시스턴트를 만들어야 한다는 뜻은 아니다. 완벽한 동일성도 나름의 실패다. 언어에는 예절, 역사, 위계, 유머, 그리고 배려가 어떻게 들려야 하는지에 대한 기대가 담겨 있다. 무뚝뚝한 영어 답변을 기계적으로 충실하게 번역하면 기술적으로는 일관되지만 사회적으로는 어색할 수 있다.

디자인 과제는 더 어렵다. 적응과 우연을 구별해야 한다.개념적 대비번역: 적응과 우연을 구별해야 한다.적응과 우연을 짧게 맞세워 문화적 맥락을 반영한 의도적 차이와 설명되지 않은 행동 변화를 구분했습니다.대안: 의도한 적응과 의도하지 않은 표류를 구별하다

그러려면 문법뿐 아니라 어시스턴트의 태도를 판단할 수 있는 검토자가 필요하다. 그 언어로 일하고 살아가는 사람들에게 비교 가능한 상황을 제시하라. 모델이 어디에서 반박했는지, 어디에서 지나치게 동조했는지, 어떤 불확실성이 남았는지, 답변의 따뜻함이 근거가 허용하는 수준보다 추천을 더 믿음직하게 보이게 했는지 물어보라. 스타일이 결과가 되는 순간을 시험하라.

최근 연구는 하나의 ‘가치’ 슬라이더로 이 문제를 해결할 수 없음을 분명히 한다. 7월에 발표된 가치 유도 관련 ACL 논문은 하나의 행동 가치를 학습시키면 때로는 대조적인 다른 행동까지 따라 움직일 수 있다고 밝혔다. 연구한 모든 가치는 의인화 언어도 늘렸고, 답변을 더 인정적이고 아첨하는 방향으로 만들었다. 페르소나 프롬프트를 통한 문화 정렬에 관한 또 다른 ACL 연구는 평균 성능이 좋아져도 인구통계학적 하위 집단 사이의 격차가 커질 수 있다고 밝혔다.

조절 장치들은 서로 연결되어 있다.

그래서 영어가 세계 AI의 보이지 않는 통제실로 남아서는 안 된다.제도적 은유번역: 영어가 세계 AI의 보이지 않는 통제실로 남아서는 안 된다.보이지 않는 통제실은 기본값을 정하고 시스템을 감시하는 공간의 이미지를 유지하면서, 그 권한이 사용자에게 드러나지 않는다는 점을 보여 줍니다.대안: 영어가 세계 AI의 숨은 지휘 본부로 남아서는 안 된다 영어는 흔히 가장 많은 학습 데이터, 가장 정교한 평가, 어시스턴트의 성격이 달라지는 것을 알아차릴 수 있는 회사 내 가장 큰 인력 집단을 보유한 언어다. 영어의 행동을 기준선이라 부르면 자원의 풍부함이 조용히 중립성에 관한 이론으로 바뀔 수 있다.

더 나은 다국어 평가는 영수증을 남길 것이다. 어떤 상황을 여러 언어에서 시험했는가? 어떤 행동 차이가 나타났는가? 그 언어를 사용하는 사람들이 어떤 차이를 적절하다고 판단했고, 어떤 차이는 여전히 설명되지 않았는가? 모델 업데이트가 어디에서 솔직함과 실행 사이의 균형을 바꿨는가? 기록이 하나의 보편적 성격을 규정할 필요는 없다. 제품이 어디에서 차이를 선택했고, 어디에서 차이가 그냥 생겼는지를 분명히 해야 한다.

이는 제품 품질의 문제이면서 접근성의 문제다. 가장 신중한 의심을 듣기 위해 영어로 바꿔야 해서는 안 된다. 불확실성을 밝히는 답변을 얻기 위해 문화적 자연스러움을 포기해서도 안 된다. AI 도구가 전 세계의 교실, 직장, 공공 서비스, 사적인 결정에 자리 잡는다면, 행동 품질은 한 언어에서만 철저히 시험한 뒤 번역할 수 있는 것이 아니다.

같은 버튼이 둘 이상의 어시스턴트를 열 수 있다.인터페이스 은유번역: 둘 이상의 어시스턴트를 열 수 있다.한 버튼으로 둘 이상의 어시스턴트를 연다는 익숙한 인터페이스 행동을 살리되, 행동 차이를 문자 그대로 별개의 인격으로 만들지는 않았습니다.대안: 버튼 하나가 서로 다른 어시스턴트를 불러올 수 있다 이제 해야 할 일은 누가 도착하고 어떻게 행동하는지 알아차리며, 모든 언어가 친절함에 솔직함이 필요한 때를 아는 시스템을 받는지 확인하는 것이다.