SHINDAN
RQ16 と MAAI を作るときに、いくつか決めたことがあります。どちらの極を選んでも点数が高くならないようにする。逆転項目を半分入れる。真ん中に近い結果には「どちらとも言い切れない」と書く。
それぞれに理由があって、そのほとんどは「性格診断はこういうところで間違える」と分かっているからです。
この記事では、その理由のほうを書きます。診断を売り込む文章ではありません。 どこまでが言えて、どこから先が言えないのかを、はっきりさせておきたいと思っています。
心理学の世界には、測定の道具を評価するための物差しが2つあります。信頼性と妥当性です。名前が似ていますが、別のものです。
同じものを測ったら、同じ値が出るかということです。
代表的な見方が2つあります。
再検査信頼性。 同じ人に、時期を変えてもう一度受けてもらって、結果がどれくらい一致するかを見ます。
内的整合性。 同じ軸を測っているはずの設問どうしが、ちゃんと同じ方向を向いているかを見ます。クロンバックのα係数という数字で表すのが一般的で、慣例的には 0.70 を超えていれば実用になる、とされています。
信頼性が高くても、測っているものが目的と違えば意味がありません。 毎回同じ値を出す壊れた体重計は、信頼性は高いけれど妥当性はゼロです。
こちらも見方がいくつかあります。
内容的妥当性。 設問の中身を見て、測りたいものを網羅しているかを専門家が判断します。
基準関連妥当性。 別の何かとの関係を見ます。将来の出来事を言い当てるか(予測的妥当性)、いま分かっている別の指標と一致するか(併存的妥当性)。
構成概念妥当性。 そもそも「その軸」が存在するのか、という一段深い話です。因子分析という手法で、設問の答え方が本当に想定した数の軸に分かれるかを確かめます。
この2つがそろって、はじめて心理検査と呼べる道具になります。
質の大半は設問で決まります。作るときに決めたことが4つあります。
いちばん分かりやすい失敗例から書きます。
人の話は、最後まで聞くようにしている
この設問は使えません。 「いいえ」と答える人が、ほとんどいないからです。全員が同じ側に寄る設問は、人を分けられません。
やっかいなのは、こういう文がいくらでも思いつくことです。「約束の時間には間に合うように動く」「AIが出したものは自分で確かめてから使う」。どれも、聞かれれば「はい」としか答えようがありません。「いいえ」は、自分が雑だと申告することになります。
原因は、良いか悪いかを聞いていることです。 「〜する/〜しない」の形にすると、たいてい片方が正しく見えます。言い回しをどう工夫しても、この形のままでは分かれません。
そこで、どちらも正しいことの間で選んでもらう形にしました。たとえば MAAI の「着手の順番」という軸は、この2つのあいだを測っています。
手を動かす前に、まずAIに投げてみる
自分の案ができてから、AIに当てる
どちらも、仕事のやり方として通ります。 前者が怠けているわけでも、後者が頑固なわけでもありません。上下が無いので、人によって本当に分かれます。
この軸の文言を決めるときは、片方を「AIに頼りすぎ」、もう片方を「AIを使いこなせていない」と読ませないことを条件にしました。どちらかが正解に見えた時点で、その軸は死にます。
全部を同じ向きで聞くと、内容を読まずに同じところを押し続けても、それらしい結果が出てしまいます。 半分を逆向きにすることで、読まずに答えたかどうかが結果に表れます。
これは検出のためでもありますが、黙従傾向(内容によらず「当てはまる」側を選びやすい癖)を打ち消すためでもあります。
オフィスや特定の職種を前提にした設問は使いません。就活生でも、普段パソコンを使わない仕事の人でも答えられるようにしています。MAAI の設問が旅行の計画や献立の話から始まるのは、そのためです。
1軸あたり12問、合計48問をプールとして用意し、短い版ではそこから各軸6問(正転3・逆転3)を選んで出しています。出題の順番も毎回変えています。 前の設問が次の答えに影響する順序効果を、特定の設問に固定させないためです。
ここがこの記事でいちばん書きたいところです。
| 内容 | |
|---|---|
| 逆転項目を半分 | 黙従傾向を打ち消し、読まずに答えたかどうかが分かる |
| 社会的望ましさの排除 | 差が出ない設問を使わない |
| 1軸あたりの項目数を確保 | 項目が少ないほど結果は揺れます。プールで48問 |
| 出題順のランダム化 | 順序効果が特定の設問に固定されない |
| 傾きの強さの表示 | 極の名前だけでなく、どれくらい寄っているかを出す |
| 相性を規則で決める | 手書きの表を持たず、4文字コードから機械的に判定 |
相性については、もう少し書いておきます。 16タイプの相性を、手で書いた 16×16 の表として持つこともできました。ただしその作り方だと、書いた人の気分が入り込む余地が大きくなります。
そこで、4文字のコードから機械的に判定する規則を先に決めて、256通りすべてがその規則から出るようにしました。「このタイプとこのタイプは、なんとなく合いそう」という判断を、途中に挟んでいません。規則そのものは各診断の「考え方」のページに書いてあるので、納得できなければ規則のほうを疑ってください。
次の4つは、やっていません。
理由は単純で、回答のデータがまだ無いからです。
これらはすべて、大勢の回答を集めて計算するものです。α係数は1軸あたり100人くらいから安定してきます。因子分析にいたっては、慣例的な目安で1項目あたり5〜10人、48項目なら240〜480人以上が要ります。
診断の画面に「回答を集計に使う」というスイッチがあります。はじめからオンになっていますが、オフにすれば送信しません。オフでも診断は最後まで受けられますし、表示される結果の内容も変わりません。ここで集めた回答で、上の4つを順に埋めていく予定です。
何を保存して何を保存しないかは、プライバシーポリシーに全部書いてあります。 端的にいうと、保存しているのは、設問ごとの回答と、軸ごとの合計点、タイプの4文字、回答にかかったおおよその時間、回答した日付です。IPアドレスも端末の情報も、あなただと分かる情報も持っていません。
ひとつだけ、設計として意図している点があります。判定した結果だけでなく、元の回答と合計点もそのまま保存しています。
判定の境界(どこからを「中間」とするか)は、いまのところ仮の値です。あとで調整する可能性があります。結果だけを保存していると、境界を変えた瞬間に過去のデータと比較できなくなります。 元の数字を持っていれば、境界を変えても全部を計算し直せます。
あとから自分の判断を疑えるように作っておく、ということです。
集計した割合は、全体で200件に満たないあいだは表示しません。 細かい分類のほうも、該当が30件に満たないものは出しません。
少ない母数で出した数字は、あとから大きく動きます。動くたびに読み手の信用が減ります。出せないときに出さないことも、誠実さのうちだと考えています。
この診断でできないことは、プライバシーポリシーの免責事項に書いています。
誰でも受けられる以上、内容を読まずに押した回答は必ず混ざります。 調査の研究では、学生を対象にした場合で8〜12%という数字が報告されていて、ある研究では11.33%が検出されました。報酬も義務もないウェブ診断は、これより高いと考えるのが自然です。
放置すると数字が歪みます。 不注意な回答を取り除いた前後で、クロンバックのα係数が 0.891 から 0.918 に上がったという報告があります。しかも逆転項目を含む尺度では改善がもっと大きく(0.697 → 0.770)、因子負荷量の平均も 0.533 から 0.573 に上がっています。
RQ16 と MAAI はどちらも逆転項目が半分なので、まさにここが効くタイプの診断です。
正直に書いておきます。全部同じ選択肢を選ぶと、必ず同じ結果になります。
1軸あたり正転と逆転が同数なので、同じ値を選び続けると打ち消し合って、合計がちょうど0になります。左端を連打しても、右端を連打しても、真ん中を連打しても、4軸すべてが真ん中の、同じタイプに落ちます。
これは避けようのない副作用です。隠さずに書いておきます。
そのぶん、検出はしやすくなっています。見ているのは次のような点です。
ひとつだけで判断はしません。 どれも、まじめに答えた人がたまたま当てはまることがあるからです。複数に当てはまったときにだけ、集計から外します。
そして、判定を本人に知らせることはありません。 判定が外れることもあるためで、結果はいつもどおり表示されます。集計に使うかどうかだけの話です。
検出とは別に、そもそも適当に答えさせないための方法もあります。調べたうえで、2つとも採らないことにしました。
「回答の質をチェックしています」という警告文を出す。 これは読ませるだけでは統計的に有意な効果が出ませんでした。文字を入力させる形にすると効果は出ますが、効果量は小さく(Cohen's d で 0.16〜0.25)、しかも離脱率が有意に上がりました。報酬のある調査なら割に合いますが、報酬のない診断では離脱がそのまま利用者を失うことなので、採りません。
引っかけ設問を混ぜる。 「この設問には『あまり当てはまらない』を選んでください」という設問です。効果はありますが、統制条件で37.1〜48%が1問以上落としたという報告があります。まじめに答えている人も普通に見落とします。 それに、24問のうち1問を検査に使うことになりますし、診断を楽しみに来た人にとっては疑われているようで気分が良くありません。
予防にコストをかけるより、検出に回すほうが得だと判断しました。
ここまでの話を踏まえて、よく知られている診断との位置関係を書いておきます。
4文字のアルファベットで性格を表す形式は、MBTI(Myers-Briggs Type Indicator)で広く知られるようになりました。ユングの心理学的類型論をもとにした、20世紀半ばの道具です。
一方、いま日本で「MBTI診断」と呼ばれて受けられているものの多くは、16Personalities という別のサービスです。自分たちのサイトで、はっきりこう書いています。
ユング派のモデルにもとづく Myers-Briggs などの理論とはちがい、私たちは認知機能のようなユング的な概念を取り入れていない
代わりに、現代の心理学・社会科学の研究で主流となっているモデルである「ビッグファイブ」の各次元を、組み直し、重みを付け直すことを選んだ
見分け方は5文字目です。「INFJ-A」「ENTP-T」のようにハイフンの後ろに A か T が付いていたら、16Personalities のほうです。この軸(Identity)はビッグファイブの情緒安定性にあたるもので、公式の MBTI にはありません。
ビッグファイブは、性格特性そのものを測るモデルです。 外向性、協調性、誠実性、神経症傾向、開放性の5つ。研究の世界で主流になっているのは、この5つが繰り返し確認されてきたからです。
RQ16 と MAAI は、そこを直接は測っていません。 測っているのは、
性格特性そのものではなく、特定の場面での振る舞い方です。ビッグファイブの言い換えではありませんし、そう主張するつもりもありません。
| 検証 | 出しているもの | |
|---|---|---|
| ビッグファイブ | 学術的に長く検証されている | 5つの特性の程度 |
| 公式の MBTI | 検証と批判の両方が積み重なっている | 16タイプ |
| 16Personalities | ビッグファイブを組み直したもの | 16タイプ+1軸 |
| RQ16・MAAI | これから検証する | 16タイプ+軸ごとの強さ |
うちは、いちばん下の行です。 これから検証する、という段階にいます。そこを大きく見せても意味がないので、そのまま書いておきます。
この形式の診断には、長く指摘されてきた弱点があります。主なものは3つです。
人の傾向は、実際には正規分布に近い形でなめらかに散らばっています。真ん中あたりにいる人がいちばん多く、両端へ行くほど少なくなります。
にもかかわらず、4文字の形式はどこかに線を引いて、こちら側とあちら側に分けます。 100点満点でいえば、49点の人と51点の人が別のタイプになる。けれどこの2人が本質的に違うと言える根拠は、どこにもありません。
答え:傾きの強さを必ず出しています。 どちら寄りかだけでなく、その傾きがどれくらい強いかを 0〜100% で表示します。真ん中に近いときは「どちらとも言い切れない」とはっきり書きます。タイプ名は覚えやすさのために残していますが、結果ページでは軸ごとの位置を先に見せる構成にしています。
①の裏返しです。線の近くにいる人ほど、ちょっとした体調や気分で向こう側へ渡ります。
答え:変わることを先に書いておく。 設問や判定は今後変わることがあり、そのときは結果も変わる場合があります。真ん中付近ほど揺れやすいことも、このページで説明しています。変わったときに「診断が間違っていた」と感じさせないためです。変わったという事実そのものが、あなたが真ん中寄りだという情報です。
採用や配置に使いたい、という話になると必ず出てくる批判です。タイプと仕事の成果のあいだに、実用になるほどの関係は見つかっていません。
答え:そもそも予測する設計にしていません。 どちらの極を選んでも点数が高くなる仕組みは入れていませんし、16のタイプはすべて対等に扱っています。MAAI は採用の場で話の糸口にすることを想定していますが、合否や評価を決める道具としては作っていません。
なお③については、擁護する側の言い分もあります。MBTI の作り手自身が「どのタイプでも成功できる」と明記していて、狙いは優劣を付けることではなかった。成果ではなく、どんな仕事を選ぶか、その仕事にどれだけ満足しているかとの関係については、有効性を示す報告があります。
そして実用の面では、こういう言い分があります。「高い開放性、平均的な外向性、低い協調性」と言われるより、「INFJ」と言われたほうが、人は自分のこととして覚えていられる。扱いやすさそのものに価値がある。
私はこの見方に近い立場を取っています。ただし、扱いやすさと引き換えに何を捨てているかは、書いておくべきだと思っています。
バーナム効果という言葉があります。誰にでも当てはまるような記述を、自分だけのことだと感じてしまう心の働きのことです。占いや性格診断が当たったように感じる理由の、かなりの部分がこれで説明できます。
診断を作る側は、これを利用することもできます。当たり障りのない、けれど当たったように感じる文章を並べれば、満足度は上がります。
そうしないために、タイプごとに「耳の痛いこと」を必ず書くようにしました。読んで少し嫌な気持ちになる部分があるとしたら、それは意図的なものです。全部が心地よい診断は、たぶん何も言っていません。
正直に書いておきます。
学術的に検証された尺度ではありません。 大学や研究機関で妥当性を検証したものではなく、運営者が設計したものです。
他人と比べた位置は出せません。 表示している 0〜100% は、あなたの回答の中での位置であって、他人と比べた位置ではありません。回答が集まってタイプごとの割合を出せるようになっても、それはこの診断を受けた人のなかでの割合です。このサイトに来る人は日本の縮図ではないので、「日本人の平均と比べて」とは言えません。
文化差の検証をしていません。 日本語で読む人に向けて書いた設問で、他の言語や文化で同じように働くかは分かりません。
これらは、回答が集まれば埋まるものと、埋まらないものが混ざっています。埋まっていないことを黙っているよりは、書いておくほうがいいと思っています。
そのうえで、自分の傾向に名前が付くと、人に説明できるようになります。 「私はこういうときに動きが鈍くなる」と言えるようになることには、検証の有無とは別の実用があります。そこを目当てに使ってもらえたら、作った甲斐があります。
careless「Procedures for Computing Indices of Careless Responding」