AOZORA / NORMALIZED
青空文庫
17,436作品・約2.7億文字・ルビ約239万組
JP-CORPUS / TEXT INDEX
青空文庫から始める、日本語オープンデータの共通索引。単語をひとつ選ぶと、作品の中でいつ、誰が、どう使ったかをたどれます。
接続中:本文は R2、索引は D1 に置く設計です。
02 / CORPUS LABS
本文を抱え込まず、正規化した索引と読み注釈を用途ごとの小さな道具へ変換します。
01 / TERM INDEX
SUGGESTED TERMS
よく検索される語は D1 の小さな集計へ。珍しい語は R2 の shard を返す設計です。
TERM / DEMO
8 時点を表示
TEXT WINDOWS
03 / READING LAB
青空文庫のルビ正規化結果を全件シャード検索し、ふりがな音声コーパス v2 の注釈集計も同じ入口へ束ねます。
音声ファイルは取得・配信せず、読み注釈と集計だけを扱います。
AOZORA / RUBY PAIRS
04 / BIBLIOGRAPHY LAB
NDL書誌ふりがなコーパスから、書名・著者名に現れる表記と読みの組を検索します。本文や画像は対象外です。
NDL / FURIGANA
05 / EXPRESSION LAB
青空文庫17,436作品の代表本文窓を、軽量な256次元文字ベクトルでブラウザ内検索します。外部ベクトルDBや画像・音声は使いません。
06 / NDL OCR
次世代デジタルライブラリーの書誌とOCR本文を、公式APIからテキストだけで参照します。画像・PDF・図版・座標データは取得しません。
07 / KOKKAI MINUTES
国会会議録検索システムの公式APIを検索します。発言本文は保存・再配信せず、会議メタデータと公式テキストへのリンクだけを返します。
08 / WORK INDEX
検索結果を本文ではなく入口として扱うための、軽い書誌インデックスです。
09 / THE FOUNDATION
取り込み・正規化・集計を一度だけ行い、そこからタイムマシン、読み辞典、表現検索を生やします。
画像は取得しません。音声コーパスも音声本体ではなく、読み注釈とメタデータを対象にします。
AOZORA / NORMALIZED
17,436作品・約2.7億文字・ルビ約239万組
NDL / FURIGANA
1,646万レコード・読み注釈約8,643万組
SPEECH / V2 TEXT
3,623注釈TXT・1,476万読み行。音声本体は未取得
NDL / OCR CATALOG
PIDカタログ395,006件。公式OCR検索と本文直読みに対応
NDL / NDC6 TEXT
NDC6分類の本文テキストを処理済み
KOKKAI / API
公式APIのメタデータ検索。発言本文は再配信しません