
2026/07/26 22:30
アニメ業界の仕事
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
このプロジェクトは、アニメ文化における驚くべき転換点を明らかにしている。2020 年代以降、店主が教師を最も一般的なキャラクターの職業として追い越し、ファンタジー役割が実世界の職業に比べて圧倒的に多数を占めている。ISCO-08 タクソノミー(436 以上の職業コードを分類する標準化されたシステム)を使用し、研究者は約 128,000 の日本語サブタイトルに対してキャラクターの職業をマッピングして、ほぼ 22,000 の作品を分析した。この研究は、キーワード一致と文脈に基づく検証のための Claude Haiku を組み合わせる高度な 2 つ段階のパイプラインを利用しており、生テキストデータを保存しないことでプライバシーが維持されている。
ライブのウェブエクスプローラーでは、ユーザーは固有のデータベースへのアクセスを必要とせずに、10 年ごとのトレンドを視覚化し、特定の職業を検索することができる。分析コストは約 34 ドルであり、オープンな Python ツールを使用して再現可能であるため、研究者にとって透明性の高い枠組みを提供する。このリソースは、業界の観測者がジャンル(例えば「異世界」)がキャラクター役割に与える影響を追跡するのを助け、また公開された CSV データ(職業数と作品マッピングを含む)を通じて独立した研究を可能にする。結局のところ、このプロジェクトはこれまで高価なデータウォールの背後で制限されていた文化的洞察へのアクセスを民主化している。
本文
アニメに描かれている現実職業:存在しない仕事の正体とは?
本研究プロジェクトでは、21,988 作品のアニメをスキャンし、各職業がどれだけの頻度で言及されているかを分析しました。国連国際労働機関(ILO)の標準分類 ISCO-08 を基盤とし、アニメ内での「名指しされていない」仕事たちを特定しています。
🚀 プロジェクトの概要と成果
趣味のためのデータプロジェクトです。LLM(大規模言語モデル)を用いた自動分類技術によって、アニメ内の職業分布を可視化しています。
🔎 ライブ・エクスプローラー
任意の職業を検索し、以下の情報を確認できます:
- どのアニメに登場するか
- 10 年ごとのトレンド変化
📊 データ提供物
- スライドデッキ: 発見された事実を楽しく紹介する 12 スライド構成のパresentation(PDF)
📈 主な発見と統計データ
分析結果に基づく主要な洞察は以下の通りです:
- 「教師」が最も頻出
- 約 1,370 作品(全体の 7.6%)で言及されています。
- アニメ界において「学校」や「教育現場」が非常に活気ある舞台となっています。
- 2020 年代のトレンド変化
- 「異世界転生」や「日常系」ブームの影響により、店主が教師を抜いて No.1 に躍り出ました。
- ファンタジー職種の優位性
- ファンタジー役割を含めると、王族(1,792 タイトル)はあらゆる現実の職業を上回っています。
- 「欠落リスト」:存在しない職業
- 登場人物として名指しが可能な職業約 150 種のうち、アニメではわずか 17 種類しか言及されていません。
- 具体的に見かけない職種:
- 金融アナリスト
- システムアナリスト
- 教習所指導員
- 印刷技師
- ファストフード店従業員
- 船舶エンジニア
- その他、バックオフィスやサービス業の末端職種
👨💻 あなたのニッチな専門職の数値化
特定の専門職がアニメに登場する頻度は以下の通りです:
- ソフトウェア開発者: 41 件
- 保険代理店: 18 件(『トリガン』の主人公は文字通り保険代理店)
- 薬剤師: 15 件
- 路面電車・バス運転手: 5 件
⚙️ 仕組みと分析方法
職業分類体系を構築し、LLM を使用して言及を検出・分類しています。結果はローカル環境で動作する静的 Web アプリケーションを通じて探索可能です。
1. データソース
- AniList: メタデータ、タイトル、キャラクターバイオグラフィ、タグの取得元。
- ISCO-08: 国際労働機関による職業分類体系(当初 436 項目から約 150 項目へ絞り込み)。
- コミュニティアーカイブ: 日本語アニメ字幕ファイル(約 128,000 ファイル)を対話データとして活用。
倫理的な取扱い
- 著作権に保護された字幕テキストは保存・再配布しません。
- データセットには派生統計、タイトル、AniList ID のみを含みます。
- 非営利のファンプロジェクトです。
2. 検出プロセス(3 レイヤー構造)
職業リストはキャラクターが合理的に識別可能な約 150 種(レンダラブル・セット)へ絞り込まれています。残りの 286 項目は「検証不可能」として報告されます。
| レイヤー | 対象 | 詳細 |
|---|---|---|
| コーパス+主人公 | プロット概要 | AniList を経由した作品全体のあらすじ分析。 |
| 準メインキャラクター | キャラクタープロフィール | 「役割フィールド」(主要/サポート/バックグラウンド)に基づき、出演程度の医師などもカウント。 |
| 対話 | サブタイトルテキスト | 字幕ファイルを活用し、一瞥された仕事の言及も検出。 |
3. 分析パイプライン(2 段階)
- 第 1 段階(高再現率)
- 英語および日本語の表面形態を ISCO コードにマッピングしたキーワード辞書を使用。
- テキスト全体を広く網羅し、誤検出を許容する設計です。
- 第 2 段階(高適合率)
- LLM (Claude Haiku) が曖昧な候補文を文脈の中で判断します。
- 以下の古典的な落とし穴を排除:
- 否定文(「医者ではありません」)
- 仮定法(「もしパイロットなら」)
- 多義語(「士官」「バンド」)
- ファンタジー同形語(「メカパイロット」と「航空会社のパイロット」の区別)
4. 精度の評価と信頼性
- 適合率・再現率推定: より強力なモデル(Claude Opus)がヒットサンプルを評価し、統計を算出。
- 信頼性フラグ: 測定された職業の約 4 分の 1 は「信頼性低い」とフラグ付けされています(例:架空の「航空機操縦士」など)。これらはカウントの上限値として扱う必要があります。
📊 データの数値読み解き(重要な留意点)
分析結果を利用する際は、以下の点を必ずご確認ください:
- 名指しされたもののみ
- テキスト内で名前が呼ばれている職業のみを検出します。
- 画面に描かれているが名前が出ない職業(祭りの屋台、ホテルフロントデスク等)はカウントに含まれません。
- 分母について
- パーセント値の横には、「スキャン可能なテキストを持つ約 18,127 タイトル」に対する割合が表示されます。
- シリーズ vs エピソード
- デフォルトでシリーズごとに重複を除きます(例:『名探偵コナン』の映画 28 作=1 とみなす)。
- 各エピソードは独立した行として保存されており、展開・折りたたみが可能です。
💻 開発者向け:実行とローカル構築
ローカル環境での動作方法
同じ UI を動作させるには以下の方法があります:
# ローカルサーバー起動 (http://127.0.0.1:8000) python ap.py web # 静的サイト生成(GitHub Pages 向け、バックエンド不要) python ap.py export-static
パイプラインの実行方法
Python 3.11 以上と Anthropic API キーが必要です。
# 環境構築 python3 -m venv .venv && ./.venv/bin/pip install -r requirements.txt echo "sk-ant-..." > api_key.txt # または export ANTHROPIC_API_KEY # 収集・抽出・評価フェーズ python ap.py collect # AniList コーパス+キャラクター+タグ(無料) python ap.py extract # ステージ 1:辞書候補生成(無料) python ap.py estimate # バッチコスト予測(無料) python ap.py adjudicate # ステージ 2:Claude Haiku による判断(有料) python ap.py measure # 適合率・再現率測定の計算(有料) # レポート生成とエクスポート python ap.py analyse # カバレッジレポート+ゼロ言及リスト python ap.py export # occupation_counts.csv, title_occupation.csv, evidence.csv を出力 # オプション:サブタイトル対話分析(レイヤー C) python ap.py subtitles-prep # 推定処理 python ap.py subtitles-match # AniList ID マッピング python ap.py subtitles-scan # 候補抽出
コストとスケール参照
- 対象: 21,988 作品のアニメおよび約 12 万 8,000 ファイルの字幕。
- LLM 消費量: 約 101,000 クロウド ハイク判断+約 2,000 オープススポットチェック。
- 総費用: 全額で約 34 ドル。
- 所要時間: 主に無人のバッチ処理により約 1 日 で完了。
リポジトリ構成概要
ap/ パッケージ本体 ├── taxonomy.py ISCO-08 階層構造+ファンタジーオーバーレイ ├── lexicon.py 英語表面形態辞書(曖昧性フラグ付き) ├── jp_lexicon.py 日本語表面形態(レイヤー C) ├── db.py SQLite スキーマ+チェックポイント管理 ├── anilist.py AniList GraphQL クライアント ├── collect.py 収集処理(コーパス・キャラクター・クラスタリング) ├── extract.py ステージ 1:辞書候補生成 ├── adjudicate.py ステージ 2:LLM による判断+コスト見積もり ├── measure.py 適合率・再現率測定制御 ├── layerc.py サブタイトルスキャン処理(テキスト保存不可) ├── analyse.py カバレッジレポート生成 ├── export.py CSV エクスポート機能 ├── webapp.py ローカルエクスプローラーサーバー └── export_static.py 静的サイト事前計算
📜 クレジットとライセンス
- 技術基盤: Anthropic (Claude API) を使用して構築。
- データ権利: データは各自の提供者(AniList, ILO の ISCO-08)の著作権に属します。
- コード利用: コードは参照用にリリースされています。表示されたデータは派生もので非営利です。
- 免責事項: 本プロジェクトは AniList、MyAnimeList、またはどのアニメスタジオとも関連性はありません。