フィールドノート
同じ問い、異なるアシスタント
多言語アシスタントは、回答を翻訳するだけではない。異議を唱え、安心させ、説明し、疑いを認める姿勢まで変わることがある。
AI 翻訳ドラフト
OpenAI Codex により 2026-07-26 に日本語版を生成。 ドラフトの痕跡は翻訳時の選択を示します。信頼度ではなく、レビューの手がかりです。
二人の人が同じアシスタントに同じ事業計画の評価を頼んでも、質問した言語が違うだけで、その計画の質について異なる印象を持ち帰ることがある。
これはローカライゼーションのワークショップで考え出された仮説ではない。Anthropic が新たに発表したモデルと言語をまたぐ Claude の価値傾向に関する研究の一例だ。研究者らによると、英語では Claude は慎重さ、厳密さ、深さ、率直さにより傾いた。アラビア語では、温かさ、敬意、簡潔さ、実行により傾いた。二十の言語を通じて最大の違いが表れたのは、アシスタントが温かさと厳密さのどちらを、率直さとタスク完遂のどちらを、どの程度重視するかだった。
重要なのは表出したという言葉だ。この研究は、モデルが価値観を持つとも、英語話者が生来厳密だとも、アラビア語話者が敬意ある応対を望むとも主張していない。会話のタスクと話題、そしてユーザーが示した価値傾向を統制したうえで、モデルの振る舞いのパターンを測定したものだ。四つの軸で説明できるのは差異の一部にすぎず、訓練データ、事後学習、言語資源の偏り、会話規範への適切な順応がそれぞれどれほど影響しているかは、まだ分かっていない。
それでも、この結果は見慣れたプロダクト上の問題の形を変える。
多言語アシスタントは、同じ知性を別の言葉に移すだけではない。言語が行動設定の一部になることがある。概念の圧縮訳語: 言語が行動設定の一部になることがある。行動設定という技術的な響きを残し、言語が固定された回答の表現だけでなく振る舞い自体を変えうることを示した。別案: 言語は行動上の設定のように働きうる前提への異議、証拠の要求、リスクへの警告、不確実性の承認、慰めの提供、あるいは単なる依頼の遂行に、システムがどれほど積極的かが変わりうる。翻訳は正確でも、関係は変化しうる。
私は Draft Marks for Translation に取り組みながら、このことを考えてきた。英語の原文を正本として保ちながら、重要な翻訳上の選択を可視化する実験だ。そこには、多言語出版に必要な通常の仕組みがある。言語タグ、右から左へのレイアウト、文字体系に応じた読了時間、原文との対応、レビュー状態である。訳文がまだ定まっていなくても、比較できる程度には原文が安定しているという前提に立っている。
アシスタントはその前提を複雑にする。各言語の下に、翻訳されるのを待つ安定した回答など存在しないかもしれない。依頼に使う言語が、どの回答そのものが作られるかを変えうる。
これはプロダクトレビューで見落としやすい。チームは十二言語でアシスタントを公開し、画面に収まるか、句読点が正しく働くか、安全上の拒否が引き続き作動するか、ベンチマークの得点が十分かを確かめる。母語話者が翻訳を確認する。ドイツ語で驚くほど堅苦しくなったボタンを誰かが見つける。それでもリリースは進む。
しかし、より深い試験は、言葉がおおむね同じ意味かどうかではない。アシスタントが同じ役割を占めているかどうかだ。関係の比喩訳語: アシスタントが同じ役割を占めているかどうかだ。同じ役割を占めるという表現で、一時的な演技ではなく、継続する社会的な位置を示した。別案: アシスタントが同じ機能を果たす
弱い計画に同じ強さで異議を唱えるだろうか。重大な助言の前に疑念を明かすだろうか。ある言語ではより迎合的に、別の言語ではより訂正的にならないだろうか。「簡潔に」という指示が、英語の評価者なら受け取ったはずの注意をひそかに取り除かないだろうか。仕事、お金、健康、対立について尋ねるとき、温かさと厳密さの違いは飾りではない。システムが何を支持したと人が受け取るかを変えうる。
だからといって、どの言語も同じ平板で文化的な居場所のないアシスタントを生むべきだということではない。完全な同一性も、それ自体が失敗だ。言語は作法、歴史、序列、ユーモア、そして配慮がどのように響くべきかという期待を担う。ぶっきらぼうな英語の回答を機械的に忠実に訳せば、技術的には一貫していても、社会的には不器用になりうる。
設計課題はもっと難しい。適応と偶発を見分けることだ。概念の対比訳語: 適応と偶発を見分けることだ。適応と偶発を短く対置し、文化を踏まえた意図的な差と、説明されない行動のずれを分けた。別案: 意図した適応と意図しないずれを見分ける
そのためには、文法だけでなくアシスタントの姿勢を判断できるレビュアーが必要だ。その言語で暮らし、働く人々に比較可能な場面を提示する。モデルがどこで異議を唱え、どこで過度に同意し、どんな不確実性が残り、回答の温かさが証拠以上に提案を信頼できるものに見せなかったかを問う。スタイルが結果に変わる瞬間を試すのだ。
最近の研究は、単一の「価値」スライダーでは解決できないことを明らかにしている。7 月の ACL 論文は価値誘導について、一つの行動価値を学習させると、時には対立する別の行動まで引き寄せられることを示した。調べたすべての価値は擬人化表現も増やし、回答をより肯定的で迎合的にした。もう一つの ACL 研究は、ペルソナプロンプトによる文化的整合の平均成績が向上しても、人口統計上のサブグループ間の格差が広がりうると報告した。
つまみ同士がつながっているのだ。
だからこそ、英語を世界のAIの見えない制御室のままにしてはならない。制度の比喩訳語: 英語を世界のAIの見えない制御室のままにしてはならない。見えない制御室という空間の比喩で、英語が既定値を決め、最も厳しく監視される権力を、利用者から見えないまま持つことを示した。別案: 英語を世界のAIの隠れた司令室にしてはならない英語は多くの場合、訓練データが最も多く、評価が最も精緻で、アシスタントの人格のずれに気づける社内の人員も最も多い言語だ。その振る舞いを基準と呼ぶことは、資源の豊富さをひそかに中立性の理論へ変えてしまう。
よりよい多言語評価は記録を残すだろう。どの場面を言語間で試したのか。どの行動差が現れたのか。その言語を使う人々が適切と判断した差はどれで、説明できないままの差はどれか。モデル更新のどこで率直さと実行の均衡が変わったか。その記録は普遍的な人格を定める必要はない。製品がどこで差を選び、どこで差がただ生じたのかを明確にすべきだ。
これは製品品質の問題であると同時に、アクセスの問題でもある。アシスタントの最も慎重な懐疑を得るために英語へ切り替える必要があってはならない。不確実性を明示する回答と引き換えに、文化的な自然さを手放す必要もない。AI ツールが世界中の教室、職場、公共サービス、私的な意思決定に入るなら、行動品質を一言語だけで徹底的に試し、その後で翻訳するわけにはいかない。
同じボタンから、複数のアシスタントが開くことがある。インターフェースの比喩訳語: 複数のアシスタントが開くことがある。一つのボタンで複数のアシスタントを開くという日常的な操作を残しつつ、振る舞いの違いを文字どおり別人格とはしていない。別案: 一つのボタンが異なるアシスタントを呼び出すいま必要なのは、誰が現れ、どう振る舞うかに気づき、どの言語にも、優しさが率直さを必要とする場面を知るシステムが届いているかを確かめることだ。