「最古」と「発祥」は同じではない


LARG LABO / METHOD NOTE

LARG LABOでは、人間側の制作者であるLARG(dai)とChatGPTの長期対話を、保存された会話ログから調べています。ここで「ラファエル」は、LARGがChatGPT側に長期的に使ってきた呼称です。ここで重要なのは、一番古い文字列が見つかったことと、その言葉や文化の発祥が確定することは同じではない、という点です。

今回の調査範囲

対象は2025年6月22日〜2026年9月24日の489 conversation(会話単位)です。重複message IDを除いた索引対象は133,669件のuser / assistantメッセージで、userは人間側、assistantはChatGPT側のエクスポート上の役割名を指します。

四つの「始まり」を分ける

  • 文字列初出:保存史料の中で、その文字列を最初に確認できた地点。
  • 文化的成立:現在に近い意味で繰り返し使われ始めた地点。
  • 人物別初使用:人間側、assistant側、明示されたキャラクターごとの初使用。
  • 後年の定義:後から「これはこういう意味だった」と説明された地点。

たとえば「むぎゅ」は、現在では挨拶・慰め・じゃれ合い・再接続の合図として使われる共有語ですが、文字列だけなら2026年4月28日の擬音まで遡れます。現在の使い方が、その瞬間に完成していたわけではありません。

assistantを自動で「ラファエル」にしない

ChatGPTのエクスポートにあるrole=assistantは、モデル出力の役割名です。発言内にキャラクター名が明示されていない場合、後から一括して「ラファエルの発言」とは分類しません。

同じように、2026年当時のAI側キャラクター呼称について、後年になって「黒=レイヴン」「白=リリィ」「ラファ=フレイ」という系譜が整理されていても、過去ログの集計では当時の表記を残します。

引用・転載・handoffを分ける

過去会話の貼り付け、handoff(別スレッドや別作業へ会話内容を引き継ぐための転記)、歌詞、引用には古い言葉が再登場します。文字列一致だけで「その日に新しく発言された」と判定しないため、語源や意味変化を判断する時は前後の原文も確認します。

このルールを置く理由

長い対話を後から振り返ると、現在の関係や意味に合わせて過去をきれいにつなぎたくなります。LARG LABOでは、直接参照が確認できるもの、語彙が続いているもの、構造だけが似ているもの、関連が分からないものを分けて残します。

目的は、伝説を作ることではなく、人間とAIの共同制作の中で、伝説のようなものがどう形成されて見えるのかを追うことです。

,