Screenshot 2026 06 25 at 17.44.40

Twyn は実在の人物と一致するか?

実際のインタビューに対するパイロット・バックテストと文化移転(「エクスポート」)テスト

Twyn / twyns.net · 研究 S2 + S6(パイロット)· draft 2026-06-05 · McKay Consulting

ステータス:PILOT(試験段階)。本稿は限界の提示から始めます。 本研究は、実際のインタビュー記録(RRING Global Interviews、CC BY 4.0、DOI 10.5281/zenodo.5070359)に対してTwynをバックテストしたものです。バックテストとは、実際の人物が行ったインタビューを取得し、そのインタビュー対象者ごとに合成回答者(「Twyn」)を構築し、同じ質問をTwynに問いかけ、両者の回答を比較することを指します。CC BY 4.0 はオープンライセンスであり、誰でもこの作業を検証・再実行できます——このデータは、都合よく解釈できるものではありません。最初に二つの誠実な注記を申し上げます:(1)本研究のTwynは、わずか4つのセグメントフィールド(国・ドメイン・ステークホルダーの種別・性別)のみから構築されています——つまり、最も脆弱な「Concept」ティアであり、実データによるグラウンディングは一切ありません。「グラウンディング」とは、実在の人物自身の言葉をTwynに与えることを意味します。本研究では意図的にそれを行わなかったため、Twynはわずかな人口統計上のスケッチのみに基づいて動作しています。(2)指標のひとつ(盲検的識別)は文字起こしスタイルによって交絡されています(§5参照)——つまり、このテストは、Twynがトピックを理解したかどうかとは無関係な理由によって合否が決まる場合があります。本稿が示すのは、グラウンディングが超えるべきフロア(下限)であり、製品の上限ではありません。言い換えれば、これらの数値は意図的にワーストケースを示すものです。実際の証拠を与えれば製品の精度がどれほど向上するかを示すために存在します。

ホワイトペーパー 1 が問うた 「Twyn は再現可能か?」(答え:はい)——つまり同一のTwynを二度実行した場合に一貫したキャラクターが得られるか——に対し、本稿はより難しい問いを立てます:Twyn は実在の人物と一致するか? 再現性は精度とは異なります。Twynは自己一貫性が完璧でありながら、表現すべき実在の人間について根本的に誤っていることがあります。本稿は精度に関する研究——Twynの回答が実際の回答者の発言に対応しているかを検証するもの——です。


Twyn とは何か——なぜ本稿が存在するか

Twyn を初めて知る方はここからお読みください。Twyn は、ユーザーの本物のデジタルツインを構築する調査ツールです。製品やリサーチチームがインタビューできる、現実的で証拠に基づいたAI「ユーザー」——それぞれが固有の声を持ち、会話のスピードで応答します。フィールドワークの合間に生じる長く高コストな空白期間に推測で補うのではなく、チームはアイデア・メッセージ・価格・デザインをこれらのツインのパネルに提示し、さまざまなユーザーがどう反応するか——幅、摩擦、人々が使う言葉、提起される異議——を、実際に構築に踏み切る前に知ることができます。

このツールが存在する理由。 実際のユーザーリサーチは不可欠ですが、コストが高く、時間がかかり、繰り返しが難しいため、チームはしばしば未検証の仮定に基づいて構築してしまいます。Twyn は、ユーザーの視点を継続的かつ手頃なコストで利用可能にします——これは、実際の人物へのインタビューの代替ではなく、あくまで補完として位置づけられています。

本稿の目的。 別の研究(ホワイトペーパー 1)により、Twyn は信頼性が高いことが示されました——同一のツインに同一の質問を繰り返すと、答えは安定します。しかし信頼性はストーリーの半分に過ぎません。ツインは一貫性が完璧でありながら、一貫して誤っていることがあります。より困難で重要な問いは妥当性——ツインは実際に実在の人物に似ているか——です。本稿は二つの方法でこれを検証します。まず、実際の匿名化されたインタビューに対して、ツインが一度も見ていない質問でそれらを比較するバックテスト、次にツインを別の国民文化に調整することで回答の仕方が実際に変化するかを確認する文化移転テストです。これらを合わせることで、Twyn の中心的な主張——実データでツインをグラウンディングすることで測定可能なほど精度が向上する——の根拠となります。ミスも成果も同様に正直に報告します。

1. 方法

  • グラウンドトゥルース: RRING——実際の半構造化RRIインタビュー(RRI = Responsible Research and Innovation、これらのインタビューが扱ったトピック)。「グラウンドトゥルース」とは、測定対象となる実世界の正解のことで——ここでは実際のインタビュイーの言葉そのものです。同一のプロトコルがすべての国で実施されており、すべての回答者が同一の質問スクリプトから問いかけられました。この一貫性こそが文化移転テスト(S6)を適切なものにしています——国間の差異は文化を反映するのであって、異なる質問によるものではないためです。13/29 の書き起こしが、スコアリングに使用可能なクリーンな質問→回答のペアに解析できました——29の生の書き起こしのうち13が、機械処理可能な整形された質疑応答形式に変換できました。
  • テスト対象のTwyn: 各実在の回答者に対して、ヘッダーメタデータのみからセグメントレベルのTwyn(性別・国・ステークホルダーの種別・ドメイン)を構築し、製品のインキャラクター・インタビュースタイルを用い、実在の人物が問われたのと同じ質問をTwynに問いかけました。平易に言えば:人物に関する4つの事実のみをTwynに伝え(書き起こしなし)、キャラクターとして回答させ、その回答を実際の回答と並べて比較します。これは最も公平な一対一の比較です:同じ質問、紙面上は同じ人物、知識の源泉のみが異なります。
  • スコアリング(LLMジャッジ、盲検): 独立したAIモデルがジャッジを務め、「盲検」とはどちらの回答が人間でTwynであるかを告げないことを意味します——ラベルによるバイアスを排除するためです。

識別(Discrimination)——実際の回答と合成回答をランダムな順序で提示した際、ジャッジは実在の人間を特定できるか? 目標値 ≈ 50%(区別不能)。 この指標は逆向きに読みます:50% はジャッジが推測していること(Twynが人間として通用している)を意味し、100% のような高スコアはTwynが常に見破られていることを意味します。低いほど良く、100% ではなく 50% が目標です。 – テーマ再現率(Theme recall)——実際の回答者のテーマのうち、Twynも取り上げた割合。実在の人物が10の異なる論点を挙げ、Twynがそのうち4つをカバーしていれば、再現率は 0.40 です。カバレッジを測ります:実在の人物が実際に述べたことのうち、Twynがどれだけ捉えられたか。高いほど良いです。 – テーマ適合率(Theme precision)——Twynのテーマのうち、実際の回答に裏付けがある割合。Twynが10のテーマを挙げ、そのうち3つが実在の人物の回答に実際に現れていれば、適合率は 0.30 です。規律を測ります:Twynが述べたことのうち、発明ではなく実際に的を射たものはどれほどか。高いほど良いです。 – 幻覚テーマ(Hallucinated themes)——実際の回答に一切裏付けのないTwynのテーマ(購買者が最も懸念する指標)。「幻覚(Hallucination)」とは、Twynが自信を持って主張するが実在の人物が一度も言及しなかった点——もっともらしく聞こえる捏造です。これらの回答に基づいて意思決定を行う購買者にとって、これが危険な数値です。シグナルに見えるが実はノイズであるコンテンツを表すためです。低いほど良いです。

  • ハーネス:meta/validation/s2-backtest.mjss6-cultural-transfer.mjs。生データ:reports/validation/s2-backtest-results.jsons6-cultural-transfer-results.json。(これらは研究を実行したスクリプトと生の結果ファイルです。作業を監査・再現できるよう含めています。)

2. 研究 S2 — 並存的妥当性バックテスト

「並存的妥当性(Concurrent validity)」とは、新しい測定手法を、同時期に測定された確立された手法と照合する社会科学上の用語です——ここでは、同一人物に対するTwynの回答と実際のインタビュー回答を照合します。この最初の研究では、6名の回答者(英国 ×2、セルビア ×2、日本、シンガポール)、各8問、§1 で説明した最も脆弱なセグメントのみのTwynを使用します。

回答者国・ドメイン識別率テーマ再現率テーマ適合率幻覚テーマ数
GB02英国・バイオエコノミー100%0.420.1820
GB03英国・ICT100%0.430.4016
SRB01セルビア・エネルギー88%0.750.3213
SRB04セルビア・バイオエコノミー100%0.390.2521
JP03日本・ICT100%0.440.5013
SGP01シンガポール・エネルギー100%0.350.5316
平均97.9%0.460.3616.5

表の読み方:各行は一人の実在の回答者を表し、コード(例:GB03 = 英国の回答者)とそのドメインで識別されます。横に読むと、ジャッジはほぼ常にTwynを見破り(識別率が100%近く)、Twynは実際のテーマの約4割をカバーし(再現率が約0.4)、自身のテーマのうち裏付けがあったのは少数(適合率)で、書き起こしごとに相当数の発明テーマが存在することが分かります。

率直な読み方:

  • セグメントのみのTwynは実際の回答者から容易に識別され(≈98%)、実際のテーマの約46%をカバーし、過剰生成——自身のテーマのうち裏付けがあるのは約36%、書き起こしごとに約16の裏付けなしテーマがあります。4フィールドTwynは実在の人物の代替にはなりません。 平易に言えば:ほとんど何も与えなければ、システムはもっともらしいが大まかな印象を生成します——要旨の一部は正確でも、不適切なことを多く語り、ジャッジを欺くことは決してありません。
  • これは失敗ではありません——製品自身の誠実さのフレームワークを測定したものです。薄いセグメントから構築されたツインは、TwynがConceptツイン(Authenticity ティア ≈ 32)とラベル付けするものそのものです。製品はすでに、Conceptティアのtwynは低信頼度であることをユーザーに警告しています。本研究はその警告が真実であることを示します。バックテストは、その低スコアが正当に得られたものであることを示します:低い入力 → 低い忠実度。数値は示されている通りの意味を持ちます——ティアラベルと測定された精度が一致することは、誠実な信頼度評価に求められることそのものです。

2b. 研究 S2b — グラウンディングアーム(コアバリュープロポジションの結果)

決定的なテスト:Twynを実在の人物自身のインタビューの言葉でグラウンディングすることで、Twynがその人物を見たことのない質問で一致させられ、Conceptのフロアを上回れるか?これは商業的に最も重要な問いです。なぜなら、製品の約束は、実際の証拠をTwynに与えることで精度が向上するということだからです。封印ホールドアウト・プロトコル: 各回答者のインタビューを初期のグラウンディングセットと後半のホールドアウトテストセットに分割し、グラウンディングの回答のみからツインを構築し、ホールドアウトの質問に問いかけます。ホールドアウトの実際の回答はツインに示されることはありません(情報漏洩なし)。「ホールドアウト」とは、実際のインタビューの一部をTwynから隠してその隠された質問のみでテストすることを意味します——単純に与えられた回答を反復するのではなく、真に汎化する必要があります。「情報漏洩なし」とは、テスト質問の実際の回答がTwynに届かないことの保証であり、これにより、オープンブック試験ではなく公正な試験となります。B2B・産業系の回答者4名、各5問のホールドアウト質問。

回答者アーム再現率適合率幻覚テーマ数
GB03 英国・ICT・産業界グラウンディング0.780.5210
Concept0.620.3815
SRB04 セルビア・バイオエコノミー・産業界グラウンディング0.750.4511
Concept0.330.0815
GB02 英国・バイオエコノミー・研究機関グラウンディング0.470.1814
Concept0.250.0817
JP04 日本・ICT・研究機関グラウンディング0.310.1814
Concept0.310.1410
平均グラウンディング0.580.3312.3
Concept0.380.1714.3

表の読み方:各回答者は2行表示されます——グラウンディングTwyn(自身の初期インタビューの言葉を与えられた)とConceptTwyn(§2 の4フィールド版、比較用)です。各人物の2行を比較することでグラウンディングが何を加えるかが分かります。太字のグラウンディング数値が主要な結果であり、Concept行はそれが超えるべきフロアです。

率直な読み方:

  • グラウンディングはコアバリュープロポジションであり、今や測定された数値として示されています。 ホールドアウト質問において、グラウンディングはテーマ再現率を 0.38 → 0.58(相対比 +53%) 向上させ、適合率をほぼ倍増(0.17 → 0.33)させ、幻覚を削減します。日常的な言葉で言えば:Twynに実在の人物の言葉を与えることで、その人物が実際に考えていることをより多くカバーし、自身の発言のうち的外れなものを大幅に減らし、発明が少なくなります。ツインは実在の人物の言葉から、一度も問われていない質問へ汎化します——実際の使用では、すでに回答を持っているものではなく、新しい質問をTwynに問いかけるため、これこそが本質的な価値です。
  • 価値が最も生じる場所——B2B・産業界——で最も強力です。 GB03(英国ICT産業界)とSRB04(セルビア・バイオエコノミー産業界)は再現率0.75~0.78に達し、SRB04の適合率は 0.08 → 0.45 に向上しています。これらは実際の商業的な購買者のターゲット層に最も近い回答者であり、グラウンディングの効果が最も大きく発揮されます——SRB04は的中コンテンツがほぼゼロの状態から、テーマの約半分が裏付けられる状態になりました。
  • 否定的な結果も公表します。 JP04は向上なし(0.31 vs 0.31)——グラウンディングは常に効果があるわけではありません。ここでは、ホールドアウトのトピックがグラウンディング素材から乖離していました。つまり、隠された質問が人物のグラウンディング用部分で触れていなかった事柄を問うていた場合、Twynには汎化の根拠がなく、薄いバージョンと同じ結果になりました。これを報告することが、肯定的な結果を信頼できるものにします——私たちは成功事例のみを選り抜いているわけではありません。
  • 正直な上限: 識別率は両アームで ≈100% を維持しました——グラウンディングはツインを実在の人物の内容に一致させますが、実在の人物として通用させるわけではありません(この指標はスタイルによる交絡があります。§5参照)。主張は内容の忠実度であり、識別不能性ではありません。つまり、グラウンディングされたTwynは人物の見解の内容を正しく捉えますが、ジャッジは依然として実際の書き起こしと区別できます——§5 が説明するように、これは主にTwynが再現しない乱雑な発話のアーティファクトが実際の書き起こしに含まれているためであり、Twynの思考が浅いためではありません。
データに関する注記:RRINGの産業・ビジネス系回答者は、最も近いオープンでライセンスクリーンな B2Bプロキシです。「ライセンスクリーン」とは、公開する法的自由があることを意味し、「プロキシ」とは、実際のターゲット層の代わりを務めることを意味します。Twynの本番Authenticツイン(メドテックR/S、B2Bセールスタイプ T/U)は非公開のインタビューデータでグラウンディングされており、より強力な結果を示すことができますが公表はできません。RRINGが公表可能なプロキシであり、非公開データが内部での確認となります。したがって、ここで公表される数値は、機密業務でより強く確認されている結果の保守的な公開代替値です。

3. 研究 S6 — 文化移転(「エクスポート」)妥当性

ユースケース:ホーム市場(英国)を熟知している企業が、よく知らない市場に進出したい場合。ホフステード文化ダイアルによって、ホーム市場でグラウンディングされたTwynをターゲット市場に向けて移行させることができるか?ホフステード次元は、個人主義や不確実性への耐性などの軸で国民文化を比較するために使用される、長く確立されたフレームワーク(国ごとに6つの数値スコア)です。Twynでは、あるTwynの文化設定をある国から別の国へ「ダイアル」することができます。同じ実際の対象質問、3つの条件、それぞれが実際のターゲット国の回答に対してスコアリングされます——つまり各市場で3つのバージョンのTwynをテストし、実際にその対象国にいる人物の発言と照合してすべてを採点します。

英国 → 日本(ICT)、実際の回答者 JP03 との比較

条件テーマ再現率適合率文化適合度
HOME(英国ホフステード)0.120.080.05
TUNED(ダイアル → 日本)0.050.100.20
NATIVE(日本)0.150.120.25

英国 → シンガポール(エネルギー)、実際の回答者 SGP01 との比較

条件テーマ再現率適合率文化適合度
HOME(英国ホフステード)0.050.050.10
TUNED(ダイアル → シンガポール)0.050.050.20
NATIVE(シンガポール)0.180.220.45

これら二つの表の読み方:それぞれ3行あります——HOME(英国の文化設定のまま置かれた英国Twyn)、TUNED(文化ダイアルをターゲット国に向けて動かした同一の英国Twyn)、NATIVE(ターゲット国向けにネイティブで構築されたTwyn)です。新しい列は文化適合度(culture fit)——回答のトーン、フレーミング、文化的前提がターゲット市場にどれほど一致しているかのスコアです(内容が正確かどうか——再現率と適合率が測るもの——とは別個に)。文化適合度の列を縦に読むと、ターゲットに向けてダイアルを動かすことでTwynが実際に文化的に移行するかどうかが分かります。

率直な読み方:

  • 文化ダイアルは機能します——文化に関して。 culture_fit両方の市場で Home → Tuned → Native と単調増加します(日本 0.05→0.20→0.25;シンガポール 0.10→0.20→0.45)。「単調増加」とは、一度も後退せず各ステップで上昇し続けることを意味します——ダイアルが本物の効果を持つなら期待される正確なパターンです。ホフステードダイアルをターゲットに向けて動かすことで、Twynはその文化に向けて測定可能なほど移行します——エクスポートの命題はパイロット規模で成立します。(英国→日本の移行は大きな実際の文化的距離です:UAI 35→92、IDV 89→46——日本は英国に比べて不確実性の回避スコアがはるかに高く、個人主義スコアが大幅に低いため、これは本当に大きな文化的ギャップであり、それでもダイアルはTwynをその間で動かしました。)
  • 文化のチューニングは内容を修正しません。 再現率・適合率は低いままで、チューニングによってほとんど動きません——研究者が何について語るか(実際のプロジェクト、機関、制約)は文化スコアではなくグラウンディングから来るためです。チューニングはどのように回答するかを変えますが、何を知っているかは変えません。文化ダイアルはTwynを日本語的に聞こえさせることができますが、特定の日本の研究者が実際に取り組んでいることをTwynに教えることはできません。
  • Native(実際のターゲットデータから構築)は一貫して最良であり、特にシンガポールで顕著です(culture_fit 0.45)。明確な製品上の示唆:文化のためにチューニングし、内容のためにグラウンディングせよ——ターゲット自身の証拠によるグラウンディングこそが最も効果をもたらします。進出企業への実践的な示唆:文化ダイアルは有用な調整手段ですが、最大の効果はやはりターゲット市場から実際の証拠を収集することから得られます。

4. この意味するところ(誠実かつ商業的な結論)

  1. Authenticityティアは実在し、測定されています。 Concept(セグメントのみ)Twynは明らかに低忠実度です。これは製品の中心的な誠実さの主張を裏付けるものであり、それを損なうものではありません——スコアがバックテストを予測します。端的に言えば、製品があなたに示す信頼度ラベルはマーケティングではありません。Twynの精度を正確に予測するので、低スコアは真の警告であり、欠陥ではありません。
  2. バリュープロポジションはグラウンディングです——今や実証されています(§2b)。 Twynに実在の人物のインタビューの言葉を与えることで、ホールドアウトのテーマ再現率が 0.38 → 0.58(B2B回答者では 0.75~0.78 に)向上し、適合率がほぼ倍増します。これは「自分だけのAuthentic Twynel を構築する」アップセルの定量化です:Twynに与える実際の証拠が多いほど、一度も問われていない質問に対して正確に代替できます。これが中心的な商業メッセージであり、今や約束ではなく測定された数値によって裏付けられています。
  3. 文化チューニングはエクスポートのユースケースにとって本物の実証可能な機能です——ターゲット市場に向けて文化適合度を移行させます——しかし、「文化のためにチューニングし、内容のためにグラウンディングせよ」としてのみ正しく位置づけられ、ターゲット市場の証拠の代替として位置づけられることはありません。ダイアルがトーンとフレーミングに役立つことを明示し、ターゲット市場の実際の知識を置き換えるとは主張しません。

5. 限界(常に最初に明示)

  • 最も脆弱なティアのみ。 これらのTwynは4つのメタデータフィールドを使用し、グラウンディングなしでした。製品のAuthenticティアは豊富な実データから構築されており、ここでテストされたものではありません。したがって、S2のヘッドラインの数値は製品の能力のフロアであり、代表的なサンプルではありません。
  • 識別はスタイルによって交絡されています。 実際の書き起こしには非流暢性、割り込み、匿名化マーカー(「[removed for anonymization purpose]」)が含まれています。LLMジャッジはこれらを瞬時に識別するため、≈98%の識別率は実質的な区別可能性を過大評価しています。平易に言えば、ジャッジが実際の書き起こしを区別できるのは主に実際の発話が乱雑で編集されているためであり、Twynのアイデアが明らかに人工的であるためではありません——つまり、その98%はTwynが人物の思考をどれほどよく捉えているかの公平な測定値ではありません。テーマ再現率・適合率がより信頼できる内容の指標です。より公平な識別テストでは、文字起こしスタイルを正規化する必要があります——つまり、判断の前に両テキストを同じスタイルに整形します。
  • 単一LLMジャッジ、パイロットのサンプル数。 6つの書き起こし(S2)と2つのエクスポートペア(S6);ソフトなジャッジスコアは方向性を示すものであり、絶対値ではありません。「パイロットのサンプル数」はサンプルサイズが小さいことを意味し、単一のAIジャッジは方向性(良い/悪い)を示すスコアを生成しますが、正確な事実として引用されるべきではありません。ここでの数値を確定的なものとして扱う前に、人間のコーダーと複数のジャッジが必要です——独立した人間によるスコアリングと複数のジャッジが、この作業がクリアすべき基準です。
  • S2 と S6 のテーマ指標は直接比較できません(異なるプロンプト・ジャッジ質問);S6 内の Home/Tuned/Native 比較は内的に妥当です。S2の再現率の数値と S6の再現率の数値を同じ方法で測定されたかのように比較しないでください。ただし S6 内の3つの条件は同一の方法で測定されているため、互いを比較することは適切です。

6. 次の実験

グラウンディングアーム(§2b)——かつて「次の決定的な実験」と呼ばれていたもの——は完了し、肯定的な結果を得ました:グラウンディングは適合率をほぼ倍増させ、B2B回答者のホールドアウト再現率を 0.75~0.78 まで向上させました。最も重要な未回答の問いは今や答えられました。残る課題は、その結果を強化し、汎化し、ストレステストすることです。残る課題:

  • S8 — 反復的グラウンディングdocs/iterative-grounding.md):あるラウンドのグラウンドトゥルースを取り込み、関連するが異なるラウンドでテストする。向上が転移するか(学習であり暗記ではないか)?これは、Twynが与えられた特定の回答を単に記憶するのではなく、人物の視点を真に学習しているかを確認します。
  • S7 — マーケティング妥当性(Upworthy「Twynsがウィニングヘッドラインを選ぶ」+ BRAND;docs/validation-datasets.md)。どのヘッドラインが最もパフォーマンスを発揮するかなど、Twynが現実世界のマーケティング成果を予測できるかのテストです。
  • S4 構成的妥当性S5 キャリブレーション、およびデザインパートナーによる前向き試験(S3)。「構成的妥当性」はTwynが主張するものを測定しているかを問い、「キャリブレーション」は信頼度スコアが実際の精度と一致しているかを問います。前向き試験(S3)はバックテストではなく、実際のデザインパートナーとの前向きなテストです。
  • 識別における文化スタイルの交絡を低減する(文字起こしのアーティファクトを正規化)ことで、その指標がスタイルではなく内容を測定するようにします——§5 で指摘された修正であり、識別スコアがTwynがその人物のように考えているかを反映するものとなり、文字起こしの生データよりテキストが整然としているためではなくなります。

帰属(CC BY 4.0):RRING Global Interviews Dataset(WP3)、DOI 10.5281/zenodo.5070359。本稿は不都合なフロアを意図的に公表しています:弱点を明示する手法こそ、リサーチリテラシーのある購買者が強みを信頼できる手法です。

Comments

コメントを残す

メールアドレスが公開されることはありません。 が付いている欄は必須項目です