繰り返し実行における Twyn の回答安定性に関するパイロット測定
Twyn / twyns.net · 研究 S1(パイロット)· ドラフト 2026-06-05 · McKay Consulting
ステータス:PILOT(パイロット段階)。 本文書は、事前登録済み研究 S1 (docs/prereg-S1-reproducibility.md)の、意図的に小規模な最初の実施を報告するものです。 「事前登録」とは、結果を見る前に調査設計と評価指標を記録・確定していることを意味します。 これにより、結果を見た後でルールを静かに変更するという自己欺瞞を防ぐ基本的な安全措置となっています。 本パイロットは 4 Twyns × 1 研究ガイド × 30 繰り返し × 2 温度アーム = 240 件のライブモデル呼び出し を実施しました。(「Twyn」とは1体の合成ユーザーを指し、 「ガイド」とは固定されたインタビュープロンプト、「繰り返し」とはそのプロンプトを独立して再度問い合わせる1回分、 「温度アーム」とはモデルのランダム性ダイヤルの1設定値を指します。詳細は後述します。) この規模の実行は、手法と知見の方向性を確立するには十分ですが、 最終ロックグリッド(より大規模な完全版の研究。質問を言い換えても同じ回答が得られるかをテストする 「パラフレーズ堅牢性」アームや、複数ガイド・モデルごとのアームを追加したもの)ではありません。 本研究の結果を正しく読み取っていただくため、この点を明示します。 すなわち、ここに示す数値は信頼できる最初の測定であり、完成した証明ではありません。 すべての数値は再現可能です。reports/validation/s1-temp07-results.jsonおよびs1-temp0-results.jsonをmeta/validation/s1-pilot.mjsで処理することで、 ファイルを持つ誰でも再生成できます。

Figure 1 — ライブ方法論パネル(twyns.net/#methodology)。Twyn はプロダクト内ですでに、 自社のスコアが「観測可能なシグナルに基づく透明なヒューリスティックであり、検証済みの予測ではない」と明示しています。 本ホワイトペーパーは、その誠実な姿勢を証拠へと変え始めるための測定です。
Twyn とは何か — そしてなぜ本論文が存在するか
Twyn を初めてご覧になる方は、ここからお読みください。Twyn は、ユーザーの本物のデジタルツインを構築する リサーチツールです。 現実的かつ根拠に基づいた AI「ユーザー」を生成し、プロダクトチームやリサーチチームが それぞれ固有の声でインタビューを行うことができます。フィールドワークの合間の長く費用のかかる空白期間に推測するのではなく、 アイデア・メッセージ・価格・デザインをこれらのツインのパネルに問いかけ、 異なるタイプのユーザーがどのように反応するかを確認できます。つまり、さまざまな意見の幅、 摩擦が生じるポイント、実際の人が使う言葉、提起される異議などを、構築にコミットする前に 把握できるのです。
このツールが存在する理由。 実際のユーザーリサーチは不可欠ですが、希少です。コストが高く、時間がかかり、 繰り返しが困難なため、チームはユーザーが誰であり何を必要としているかについて、 検証されていない仮定の上に構築してしまいがちです。Twyn は、ユーザーの視点を継続的かつ手頃な価格で利用できるよう設計されています。 そして重要なのは、Twyn はリアルな人との対話を補完するものであり、代替するものでは決してない ということです。 どこを見て何を尋ねるべきかを判断する助けとなるものであり、最終的な判断はリアルなリサーチに委ねられます。
なぜ本論文を書いたか。 ユーザーを代弁すると主張するツールが信頼を得るためには、 実際にどの程度うまく機能しているかについて正直でなければなりません。そのため私たちは測定を行い、 限界も含めた結果を公開します。Twyn の回答は大規模言語モデルから生成されますが、これは 確率的 です。 同じことを2回問いかけると、文章が — 時には内容が — ずれることがあります。 したがって、購入者が最初に尋ねる権利を持つ最も基本的な問いは 信頼性 についてです。 同じツインに同じ質問を何度も問いかけたとき、回答はどれほど安定しているか? 信頼性はあらゆる評価の前提条件です。単に繰り返すだけでぐらつく測定は、 どんなに個々の回答がもっともらしく聞こえても信頼できません。本(パイロット)研究はまさにそれを測定します。
1. 問いの設定
本節では、このパイロットが答えようとしている単一かつ限定された問いを述べます。
Twyn を動かす大規模言語モデルは 確率的 です。つまり、内蔵されたランダム性の要素を持ちます。 同じことを2回問いかけると、文章が — 時には内容が — 変化することがあります。 これはこの技術の正常な動作であり、欠陥ではありません。しかし Twyn が実際のリサーチ上の意思決定に 使用されるとすれば、購入者には率直な問いを発する権利があります: 同じ Twyn に同じ質問を 30 回問いかけたとき — 回答はどれほど安定しているか? 毎回の問い直しで回答が大きくぶれるなら信頼できませんが、 毎回同じ場所に着地するなら信頼できます。
本論文全体を貫く区別は、信頼性 と 精度 の違いです。信頼性とは「繰り返したとき一貫した回答を返すか」を意味し、 精度(より正確には 妥当性)とは「その回答が実際の人間の言うことと一致するか」を意味します。 これらは独立した概念です。Twyn が完全に再現可能で — 毎回同じことを言いながら — 実際の人間について 間違っている可能性もあります。信頼性は必要な一階層目です。 自分自身とすら一致しない測定器は、何の用途にも信頼できません。妥当性は別の問いであり、 後続の研究 S2–S3 で扱います。S1 は意図的に信頼性を分離し、 Twyn の成績が芳しくない部分も含めて誠実に測定します。
2. 方法(パイロット)
本節では、以下の数値を正しく評価できるよう、実施内容を正確に記述します。 平たく言えば:4体の合成ユーザーを選び、それぞれに同じ質問を 30 回問いかけ、 2種類の異なるランダム性設定のもとで実施し、定量化できる構造化された形式で回答を記録しました。
- Twyns(4体、固定): A · Astrid Lund(デンマーク)、K · Marcus Thompson(アメリカ合衆国)、
L · Aiko Hasegawa(シンガポール)、S · Annika Vogel(ドイツ)。「固定」とは、研究期間中に 定義を変更しなかったことを意味します。異なる文化圏にわたって選定しており、 ほぼ同一のペルソナ4体でテストを行わないようにしています。
- 刺激(ガイド 1 本): 固定されたコンセプトテスト用プロンプト(「AI による顧客デジタルツイン」に対する
Twyns の反応)。プロンプトは、自然な自由記述の回答に加え、機械的に解析・集計できるよう、 具体的なタグ付きフィールドを 3 つ要求します: ADOPT(採用するか否か:yes/no/maybe の判断)、LIKELIHOOD(採用可能性の 0–10 評価)、 TOP_CONCERN(主な懸念事項、自由記述)。
- 繰り返し: 1 Twyn あたり k = 30 回の独立した呼び出し。30 は統計学における一般的な最小サンプルサイズであり、
平均と散らばりが安定するのに十分な規模でありながら、パイロットとして低コスト・高速に実施できます。
- 温度アーム:「温度」はモデルのランダム性ダイヤルであり、高いほど語句が多様になり、
低いほど繰り返しが多くなります。通常のプロダクション設定(0.7)と、 基準点としてモデルが許容する最低かつ最も決定論的な設定(0)の 2 つを実行しました。
- プロンプト: 実際の プロダクションインタビューシステムプロンプトを使用しました。
これは、ライブプロダクトがモデルに与える実際の指示であり、プロダクトのソースファイル index.html から逐語的に抽出しています(buildInterviewSystemPrompt + describePsychometrics + describeHofstede)。 テスト用に簡略化した代替物ではなく、実際に出荷されているプロダクトを測定したことを意味するため、 この点は重要です。
- 評価指標: 各回答タイプに応じた適切な指標を選択しました。詳細はセクション 3 で順に平易な言葉で説明します。
判断(ADOPT)については、最頻カテゴリー一致率とエントロピー。評価(LIKELIHOOD)については、 平均、標準偏差、変動係数、ICC(2,k)。懸念テキスト(TOP_CONCERN)については、 ペアワイズ語彙コサイン類似度と Jaccard 重複率。
3. 結果
本節では、最も強い軸から弱い軸の順に、各軸の結果を報告します。 要約すると、判断と評価 は再現性が高く、正確な表現 は再現されませんでした。 どちらについても明示的に述べます。
3.1 構造化出力の信頼性
内容 の再現性を測定する前に、まず配管を確認します: すべての実行が、要求した構造化・機械読み取り可能な形式で返ってきたか? 240 / 240 件(100%) がすべての 3 フィールド(ADOPT、LIKELIHOOD、TOP_CONCERN)を 解析可能な形式で返し、破棄や手作業での修正は一切必要ありませんでした。 構造化誘出フォーマット(自由記述ではなくタグ付きフィールドを要求する方式)自体が 高い信頼性を持っており、これはこれ以降のすべての評価の実用的な前提条件です。
3.2 判断の再現性(ADOPT)— 高
これは最も意思決定に関連する軸です:同じ Twyn に再び問いかけたとき、同じ yes/no/maybe の判定に至るか? 「最頻判断」とは 30 回の試行のうち最も多く現れた回答を意味し、「一致率」はそれに一致した試行の割合です。 すべての Twyn が 80〜100% の試行で同一の最頻判断 を返しました。 つまり、判定は圧倒的に多くの場合において安定していました。
| Twyn | 出身地 | 最頻判断 | 一致率(0.7) | 一致率(0) |
|---|---|---|---|---|
| A Astrid | デンマーク | maybe | 100% | 100% |
| K Marcus | アメリカ合衆国 | maybe | 100% | 100% |
| L Aiko | シンガポール | maybe | 100% | 100% |
| S Annika | ドイツ | maybe | 87% | 80% |
| プール平均 | ~97% | ~95% |
表の読み方:4体のうち3体は毎回まったく同じ判断を返し(100%)、 最も変動の大きい Annika でさえプロダクション設定では 87%、温度 0 では 80% の自己一致率でした。 4体をプールすると、判断は約 97%(プロダクション)および 95%(基準)の確率で繰り返されました。 実用的ないかなる基準から見ても高い再現性です。
注意事項(アルファのパラドックス): ここには正直な統計的論点があります。 ほぼすべての Twyn のほぼすべての回答が「maybe」であったため、カテゴリーの散らばりは 縮退 しています。 そのような状況では、Krippendorff の α という標準的な一致統計が情報量を持たなくなります (0.08〜0.14 という値を示し、表から一目瞭然の高い一致率とは裏腹に、非常に低く見えます)。 これは有病率問題(prevalence problem)と呼ばれる既知の特性です。 1つの回答が支配的なとき、α はほとんど変動を持たず崩壊してしまいます。 たとえ信頼性が実際には高くても、です。そのため私たちは意図的に 最頻一致率を代わりに報告します。 これはこの問題に影響されません。また、これはプロダクトとして重要な発見でもあります: 1つの yes/no/maybe 項目は非常に少ない情報しか持たないため、 より豊かな意見収集方法が必要です(§5 参照)。
3.3 評価の再現性(LIKELIHOOD 0–10)— 高
ここでは、0–10 の採用可能性評価が繰り返しにおいて安定しているかを確認します。 重要な点が2つあります:各 Twyn 自身の評価が 30 回の試行を通じてどれほど集中しているか(散らばりが小さい = 信頼性が高い)、 そして4体の Twyns が互いに分離しているか(明確な分離 = 測定器がペルソナを区別できる)。 どちらも良好な結果でした。
| Twyn | 平均 ± SD(0.7) | CV(0.7) | 平均 ± SD(0) | CV(0) |
|---|---|---|---|---|
| A Astrid | 5.33 ± 0.71 | 0.133 | 5.50 ± 0.63 | 0.114 |
| K Marcus | 5.07 ± 0.45 | 0.089 | 5.17 ± 0.38 | 0.073 |
| L Aiko | 5.87 ± 0.35 | 0.059 | 5.43 ± 0.50 | 0.093 |
| S Annika | 2.90 ± 0.40 | 0.139 | 2.80 ± 0.41 | 0.145 |
表の読み方:「平均」は各 Twyn の 30 回の試行にわたる平均評価値、「SD」(標準偏差)は個々の試行が その平均からどの程度ずれるかの典型値、「CV」(変動係数)は SD を平均で割った比率であり、 平均が異なる Twyns 間で散らばりを公平に比較できます。CV が低いほど一貫性が高いことを意味します。
- 変動係数 ≈ 6〜15% — 実用的に言うと、同じ Twyn の採用可能性評価は試行ごとに
10点スケールの ±0.5 点 程度変動します。これは小さな値であり、評価に意味があることを示します: 再問いかけで 6 が 3 に反転することはありません。
- ICC(2,k) = 0.872(temp 0.7)および 0.874(temp 0) — ICC(級内相関係数)は、
0(純粋なノイズ)から 1(完全)までの標準的な信頼性スコアです。 通常の目安として 0.75 超が「良好」、0.9 超が「優良」とされており、 0.872 は強固な範囲に明確に位置します。これは2つの良い特性を同時に捉えています: 同じ Twyn が繰り返しにわたって一貫していること(再検査信頼性)と、 Twyns が互いに明確に区別できること(弁別可能性)です。 1つの正直な留保事項:ここでの ICC は4体の Twyns を比較単位として扱っており、 4ユニットのみでは数値は 示唆的 にとどまり、最終的ではありません。 フルグリッドで確認が必要です。
3.4 表現の再現性(TOP_CONCERN)— 低く変動が大きい
これは正直に認める弱い軸であり、その点から始めます。私たちは最も厳しいバージョンの問いを立てています: 主要な懸念事項の 正確な表現 は言葉通りに繰り返されるか?繰り返されません。 試行を通じて 語彙コサイン(2つのテキストが同一の単語をどれだけ共有するかの 0–1 の指標。1 が同一表現、 0 が共有語なし)は 0.00 から 1.00 の全域にわたり、異なる表現の数は 30 回中 4〜27 種 でした。 つまり、Twyns によっては、ほぼ毎回異なる表現が使われていました。 しかし、根底にあるテーマ は安定していました。たとえば、Astrid は「合成データが検証済みの洞察と 誤認される」というテーマを繰り返し取り上げ、Annika は「シミュレーションが顧客現実と 誤解される」という懸念を繰り返し提起しました。文章自体は毎回異なっていても、です。 要約すると:表面的な表現は変化するが、意味はおおむね保たれます。 これは、自由記述の再現性を測定する正しい方法が文字列一致ではなく テーマ(意味的)レベルであること、 そして完全版の研究で文章埋め込み(言葉ではなく意味を比較)と人間によるテーマコーディングを 使用する理由です。ここで報告する語彙指標は意図的に保守的な下限であり、 意味の観点では Twyn を実際よりも悪く見せます。これは安全な方向での誤りです。
3.5 温度 0 は決定論をもたらさない
購入者が自然に抱く問いがあります:「ランダム性をオフにすれば、毎回同じ回答が得られるのでは?」 基準アームがこれに直接答えます。温度を 0 に設定すること — 利用可能な最低設定 — は、 信頼性をほとんど変えませんでした(ICC は 0.872 から 0.874 への微小な変化にとどまり、 評価と最頻判断は本質的に変わらず、4体中3体で依然として表現が変動しました)。 重要な正直な指摘: 温度を下げるだけでは、試行間の変動を排除することはできません。 これらのモデルが計算する方法には、ある程度の確率性が内在しています。 したがって正しいエンジニアリングの姿勢とは、変動を 測定して開示する べき特性として扱うことです。 これはまさに本研究全体が行っていることです。変動をオフにできるものとして扱うのではなく。

Figure 2 — 本研究の4体の Twyns の1つ、Twyn A · Astrid Lund がプロダクト内でどのように表示されるか: Authenticity スコア 78、Predictive/一貫性推定 91%、平易な言葉による変化率ラベル。 S1 は、Predictive の数値をヒューリスティックではなく 測定値 にするための研究です。
4. この意味するところ
本節では、結果を購入者が実際に受け取るべき内容へと翻訳します。 そして、Twyn が得意なこと・苦手なことを踏まえた上で、どのように責任を持って使用するかを示します。
- 判断・評価レベルの再現性は強固です(最頻一致率 ~96%、評価 ICC ~0.87)。
Twyn がユーザーに実際に提示する種類のアウトプット — 方向性(採用する/しない)、 相対評価、懸念事項のランキング — については、繰り返し実行が実用的に十分安定しています。 ただし、結果をテーマ/判断レベルで読む ことが前提であり、精密なオラクルとして扱わないことが条件です。 これがコアとなる商業的な安心材料です:インタビューを再実行しても、矛盾した回答は返ってきません。
- 表面的な表現は試行ごとに再現されません。そのことを明示します。 実用的な指針は直接導かれます:
Twyn からの逐語的な引用は 実例 として扱い、固定した事実としては扱わないこと、 そして特定の1文ではなく繰り返し現れる テーマ を信頼することです。 そのように使えば、弱い軸は罠ではなくなります。
- 測定された一貫性スコアがヒューリスティックなものに取って代わります。
現在プラットフォームの「Predictive / 一貫性」スコアは、誠実ではあるが未測定の推定値(透明なヒューリスティック)です。 S1 は、それを 測定値 にするための素材を提供します。各 Twyn の実際の CV、最頻一致率、 テーマ再現率から導出されます。これは、その軸の「誠実な数学ループ」を閉じるものです (内部では Epic O として追跡):表示される数値が主張ではなく、検証されたものになります。
- 弁別妥当性の初期シグナルが自然発生しました。「弁別妥当性」とは、
測定器が本当に異なる人々を区別できることを意味します。ドイツの Twyn(Annika)は一貫して 他の Twyns(~5–6)よりもはるかに懐疑的で、採用可能性評価は 2.8/10 でした。 この明確な分離は研究 S4 が意図的にテストするために設計しているものであり、 ここではそれを証拠として主張しません。しかし、信頼性のみを測定するはずだった研究において、 分離が自然に、かつ安定して現れたことは励みになります。
5. 限界(率直に記述)
これらは、パイロットを過大評価しないための理由です。 軟化することなく目立つように列挙します。購入者は肯定的な知見と同様に真剣にこれらを考慮すべきです。
- パイロット規模: ガイド 1 本、Twyns 4 体、モデル 1 種。これはまだロックグリッドではありません。
パラフレーズ堅牢性アーム(質問を言い換えても回答が保たれるかのテスト)も、 複数ガイドも、複数モデルもありません。したがって、4ユニットのみで計算された ICC と α の数値は 示唆的にすぎず、フルスケールで確認が必要です。
- 天井効果: 特定のコンセプト質問がほぼすべての回答を「maybe」に追いやり、
カテゴリカルなシグナルを平坦化しました(§3.2 のアルファのパラドックスと同じ問題です)。 将来のガイドでは、実際にペルソナ間で弁別が生じる項目を含める必要があります。 「ほぼ全員が maybe」ではなく、実際の多様性に対して判断軸がテストされるようにするためです。
- 語彙指標(意味的ではない)の自由記述評価: §3.4 で述べたように、
表現の指標は意味的安定性の実態を過小評価しています。見出しとなる自由記述再現性数値を公表する前に、 埋め込みと人間コーディングへのアップグレードが必要です。
- 信頼性 ≠ 精度: 明確にするために述べますが、本論文のいかなる内容も Twyns が実際の人間と
一致することを示すものではありません。一貫性は正確さではありません。 それを実証するのは研究 S2–S3 の仕事であり、この研究ではありません。
6. 次のステップ
本節では、パイロットを完全かつ防御可能な研究へと発展させるために行うことを述べます。
- 完全ロック S1 グリッドの実行: 10-パラフレーズ堅牢性アーム(同じことを 10 通りの異なる方法で尋ねる)を追加し、
ペルソナ間で実際に弁別が生じる項目を含む少なくとも 2 本のガイドを用意し、 モデルごとのアームを追加します。また、自由記述指標を文章埋め込み+人間によるテーマコーディングにアップグレードします。
- 測定された一貫性スコアをプロダクト表面に接続: プロファイルドロワー(Figure 2)でユーザーが
見る数値がヒューリスティックではなく測定を反映するようにします。
- S2(同時妥当性)への移行: オープンライセンスのセグメントラベル付きリアルインタビューデータ
(データセット調査進行中)との比較。これが 精度(この信頼性パイロットが意図的に扱わない 別の問い)に言及する最初の研究です。
付録 — 再現方法
完全な透明性のために、本論文のすべての数値は、以下の2つのコマンドを実行することで (温度アームごとに1つ)、元の結果を生成するために使用したスクリプトを使って誰でも再生成できます: “ cd twyns-net TWYNS=A,K,L,S REPS=30 TEMP=0.7 node meta/validation/s1-pilot.mjs # production arm TWYNS=A,K,L,S REPS=30 TEMP=0 node meta/validation/s1-pilot.mjs # reference arm ` 生データ:reports/validation/s1-temp07-results.json、s1-temp0-results.json`。 パイロット総コスト:~$1.50(240 件の呼び出し、Sonnet 4.6)。パース失敗ゼロ。 低コストとクリーンなパース率自体がポイントの一部です。このプロダクトに対する信頼できる信頼性チェックは 安価かつ繰り返し可能であり、プロダクトの進化に合わせて再実行できます。

コメントを残す