AI開発・研究のための日本語会話データ
日本最大級の匿名掲示板「5ちゃんねる」の公開投稿を、構造化された形式で。過去アーカイブから継続的な最新データまで提供します。
5ちゃんねる運営者による一次ライセンス提供です。
大規模なネイティブ日本語
実際に書かれたままの口語日本語。俗語、略語、顔文字、板ごとの語彙。Webクロール由来のコーパスでは十分に得られない種類のテキストです。
長期にわたるアーカイブ
日本のインターネット史をまたぐ継続的なアーカイブと、日々更新される最新データ。
スレッド構造を保持
平文ではありません。スレッド、投稿、レス・引用関係、板分類、タイムスタンプを保持した形式で提供します。
要件に応じた構成
板、期間、スレッド長、内容種別によるフィルタリングに対応。配信形式・更新頻度はプロジェクトごとに設定します。
来歴の明確性
運営者からの直接ライセンス。エンタープライズ・公共調達のデューデリジェンスに耐える来歴記録を提供します。
標準的な形式
JSONL・Parquet を標準対応。その他の形式・配信方法もご相談に応じます。
クロールではなくライセンスを選ぶ理由
完全性
クロールで取得できるのは、構造が失われた部分的な複製です。スレッドの欠落、レス関係の消失、過去データの不足、レート制限による網羅性の低下が生じます。当社は元データを構造を保ったまま提供します。
来歴
公共調達・規制産業・エンタープライズ導入を想定するモデルでは、学習データの供給経路の説明責任が求められる場面が増えています。一次提供者との契約は、その最も確実な裏付けとなります。
学習以外の利用
検索・要約・回答生成といった用途は、モデル学習とは異なる形でソースを利用します。ライセンス契約により、これらの権利範囲を明示的に定めることができます。
コーパスの内容
5ちゃんねるは、話題別の「板」、板に属する「スレッド」、スレッド内の連番投稿という階層で構成される大規模な日本語匿名掲示板です。当社がライセンス提供するのは、その公開投稿の記録と、それを意味づける構造メタデータです。
本コーパスには、口語・非formal日本語、ネットスラング、顔文字、多人数の対話構造が高密度に含まれます。同等の規模と継続性で入手することの難しい学習シグナルです。
{
"post_id": "5ch:news4vip:1712345678:0042",
"thread_id": "5ch:news4vip:1712345678",
"board_id": "news4vip",
"board_name_ja": "ニュー速VIP",
"board_category_ja": "雑談系",
"post_index": 42,
"posted_at": "2024-04-05T21:14:38+09:00",
"posted_at_precision": "second",
"name_field": "以下、5ちゃんねるからVIPがお送りします",
"poster_id": "aB3xY9Zk0",
"body_text": "そういうのはこっちのスレでやってくれ\n>>38 が言ってたやつな",
"body_normalized": "そういうのはこっちのスレでやってくれ >>38 が言ってたやつな",
"reply_to": [38],
"quoted_spans": [
{ "target_post_index": 38, "raw": ">>38" }
],
"char_count": 34,
"contains_ascii_art": false,
"redaction_profile": "standard",
"redactions_applied": 0,
"source_snapshot_id": "snap-2026-08-01",
"record_version": 1
}データサンプルをご請求ください。
適格な組織の方には、代表的な技術サンプル、スキーマ仕様書、データセット概要をご提供します。
