AI公開 データ取得日

Hugging Face の日本語タグのモデルは、他の言語と同じペースで増えているのか。5言語の全件を作成月で数えた

AI のモデルを公開・共有するサイトの Hugging Face には、モデルごとに対応する言語のタグを付けられる。日本語のタグ(ja)が付いたモデルは、2026年9月26日の時点で19,293件あった。同じ日に数えた中国語(zh)は33,593件、フランス語(fr)は23,025件だ。では、日本語タグのモデルは、他の言語と同じペースで増えているのか。

先に答えを書く。日本語タグのモデルは、韓国語とほぼ同じペースで増えていた。フランス語・ドイツ語よりは速く、中国語よりは遅い。 5つの言語の延べ数に占める日本語の割合は、2024年以降17%前後でほとんど変わっていない。ただし、この数字には注意がいる。2025年以降に作られた日本語タグのモデルの4割以上は、10以上の言語タグを持つ「多言語のモデル」で、その多くは他の言語にも数えられている。

この記事で確かめたのは、日本語タグの付いたモデルは、他の言語と同じペースで増えているのか、という点だ。日本語・韓国語・中国語・フランス語・ドイツ語の5つの言語タグについて、Hugging Face の API でモデルを全件取得し、作成された年・月ごとに数えて比べた。あわせて、タスクの内訳とダウンロード数の集中も見ている。データの取得日は 2026-09-26(UTC)だ。比べる範囲は 2022年4月〜2026年8月(UTC) で、その決め方と取得の条件は、記事の終わりの付録Aにまとめた。

作成年別に数えると、5つの言語とも増えている

まず、作成年ごとの件数を見てみよう。表は、作成年ごとの件数と、前の年との比だ。2026年は8月までなので、最後の列は2025年と2026年の1〜8月どうしで比べている。

言語タグ 2022年(4〜12月) 2023年 2024年 2025年 2026年(1〜8月) 2024年÷2023年 2025年÷2024年 2026年1〜8月÷2025年1〜8月
日本語(ja) 252 1,237 3,684 5,282 7,661 2.98倍 1.43倍 2.10倍
韓国語(ko) 180 1,114 3,902 4,747 7,013 3.50倍 1.22倍 2.16倍
中国語(zh) 392 2,023 4,689 8,707 15,006 2.32倍 1.86倍 2.58倍
フランス語(fr) 542 1,795 4,601 6,544 8,161 2.56倍 1.42倍 1.83倍
ドイツ語(de) 360 1,501 4,366 5,639 7,295 2.91倍 1.29倍 1.84倍

2023年以降、5つの言語とも、前の年より多くのモデルが作られていた。日本語は、2024年が2023年の2.98倍、2025年が2024年の1.43倍、2026年1〜8月が前の年の同じ期間の2.10倍だ。

伸び方を比べやすくするため、日本語の件数を他の言語の件数で割った値も出した。この値が年によって変わらなければ、日本語はその言語と同じペースで増えていることになる。

比べる相手 2022年(4〜12月) 2023年 2024年 2025年 2026年(1〜8月)
日本語 ÷ 韓国語(ko) 1.40 1.11 0.94 1.11 1.09
日本語 ÷ 中国語(zh) 0.64 0.61 0.79 0.61 0.51
日本語 ÷ フランス語(fr) 0.46 0.69 0.80 0.81 0.94
日本語 ÷ ドイツ語(de) 0.70 0.82 0.84 0.94 1.05
5言語の延べ数に占める日本語 14.6% 16.1% 17.3% 17.1% 17.0%

最初の問いへの答えは、比べる相手によって分かれた。

  • 韓国語とは、ほぼ同じペースだ。 2023年以降、日本語 ÷ 韓国語は 0.94〜1.11 の間だった。
  • フランス語・ドイツ語よりは速く増えている。 日本語 ÷ フランス語は2023年の0.69から2026年1〜8月の0.94に、日本語 ÷ ドイツ語は0.82から1.05に上がった。2026年1〜8月は、日本語タグのモデルの数がドイツ語を上回っている。
  • 中国語よりは遅く増えている。 日本語 ÷ 中国語は2024年の0.79から、2026年1〜8月は0.51に下がった。2026年1〜8月の伸びは、中国語が2.58倍で、5つの中で最も大きい値だ。

5つの言語の延べ数に占める日本語の割合は、2024年以降17.0〜17.3%で、ほとんど変わっていない。

月別に並べると、山が同じ月に来る

年別だけでは、増え方の細かい形が見えない。そこで、月別の推移も見てみよう。作成月別の件数の推移で、2023年8月以降を並べた。フランス語はドイツ語とほぼ同じ形のため、グラフには入れていない。

日本語・韓国語・中国語・ドイツ語のタグが付いたモデルの、作成月別の件数(2023年8月〜2026年8月)。4つとも2024年11〜12月、2025年12月、2026年3〜4月に同じように山がある。2026年3月以降は中国語が他の3つの2倍前後で、2026年8月は中国語2,778件、日本語1,322件、ドイツ語1,292件、韓国語1,123件。
単位: 件(その月に作成されたモデルのうち、取得日に公開されていたもの)。期間: 2023年8月〜2026年8月(UTC)。フランス語と2023年7月以前は年別の表のみ。出典: Hugging Face Hub の /api/models(2026-09-26 取得)を自分で集計

2025年以降は、日本語・韓国語・ドイツ語の3本がほとんどの月で重なるように動いている(2025年1月〜2026年8月の20か月のうち18か月は、3つのうち最も多い言語の件数が、最も少ない言語の1.5倍以内だった)。2024年までは、ドイツ語や韓国語が日本語の1.5倍を超える月もあり、3つの言語の件数が1.5倍以内に収まったのは2023年8月〜2024年12月の17か月のうち8か月だった。件数が大きく増えた月も4つの言語でそろっていて、2025年12月と2026年3月は、どの言語もその前の月より増えた。中国語は2025年2月以降、どの月も他の3つより多く、2026年3月以降は2倍前後の件数だ。2026年8月の件数は、中国語2,778件、日本語1,322件、ドイツ語1,292件、韓国語1,123件だった。

言語の違うモデルが、同じ月にそろって増えたり減ったりしているのはなぜか。それを見るため、1つのモデルに付いている言語タグの数を数えた。

件数の中身: 同じモデルが、いくつもの言語に数えられている

1つのモデルには、言語タグをいくつでも付けられる。そこで、各モデルの tags のうち、Hugging Face の言語の一覧にある2文字のコード(en・ja など)がいくつ付いているかを数えた。

言語タグ 2文字の言語タグがその言語だけ en も付いている 2文字の言語タグが10以上 2文字の言語タグの数(中央値)
日本語(ja) 3,876(20.1%) 15,029(77.9%) 7,529(39.0%) 8
韓国語(ko) 3,930(21.9%) 13,815(77.0%) 7,490(41.7%) 8
中国語(zh) 4,418(13.2%) 28,752(85.6%) 8,010(23.8%) 2
フランス語(fr) 3,337(14.5%) 18,977(82.4%) 8,920(38.7%) 8
ドイツ語(de) 2,436(11.9%) 17,532(85.9%) 8,617(42.2%) 8

日本語タグのモデルのうち、言語タグが日本語だけのものは20.1%だった。反対に、39.0%(7,529件)は10以上の言語タグを持っている。この7,529件のうち89.4%は、5つの言語のタグをすべて持っていた。日本語・韓国語・フランス語・ドイツ語では、4割前後のモデルが「10以上の言語に対応」とされたモデルだ。5つの言語すべてで、この「10以上」に入っているモデルは6,734件あり、4つの言語の「10以上」の多くは同じモデルになる。中国語だけは、10以上のモデルが23.8%と少なく、言語タグの数の中央値も2だった。

この10以上の言語タグを持つモデルの割合を、作成年別に見た。日本語・韓国語・フランス語・ドイツ語では2025年に大きく上がり、中国語は2024〜2026年も2割台(23.8%・29.2%・22.4%)だった。

言語タグ 2022年(4〜12月) 2023年 2024年 2025年 2026年(1〜8月)
日本語(ja) 22.2% 23.3% 27.1% 44.0% 43.7%
韓国語(ko) 31.7% 24.0% 26.1% 48.4% 47.5%
中国語(zh) 22.7% 16.9% 23.8% 29.2% 22.4%
フランス語(fr) 19.9% 20.1% 26.9% 42.0% 47.0%
ドイツ語(de) 17.2% 21.8% 27.7% 47.4% 51.3%

日本語では、2024年に作られたモデルの27.1%だったのが、2025年は44.0%、2026年1〜8月は43.7%になった。2025年以降に作られた日本語タグのモデルは、4割以上が10以上の言語タグを持つモデルだ。

では、10以上の言語タグを持つモデルと、9以下のモデルに分けると、伸び方はどう違うのか。2025年1〜8月から2026年1〜8月への増え方を分けて数えた。

言語タグ 2025年1〜8月→2026年1〜8月の増加 うち言語タグ10以上のモデルの分 言語タグ10以上の伸び 言語タグ9以下の伸び
日本語(ja) 4,013 1,820(45.4%) 2.19倍(1,527→3,347) 2.03倍(2,121→4,314)
韓国語(ko) 3,767 1,826(48.5%) 2.21倍(1,505→3,331) 2.11倍(1,741→3,682)
中国語(zh) 9,186 1,671(18.2%) 1.98倍(1,697→3,368) 2.82倍(4,123→11,638)
フランス語(fr) 3,692 1,987(53.8%) 2.08倍(1,848→3,835) 1.65倍(2,621→4,326)
ドイツ語(de) 3,331 1,948(58.5%) 2.09倍(1,793→3,741) 1.64倍(2,171→3,554)

日本語タグのモデルの増加4,013件のうち、45.4%は10以上の言語タグを持つモデルの分だった。この部分は、どの言語でも1.98〜2.21倍で、ほぼ同じ伸びだ。韓国語・フランス語・ドイツ語でも、増加の48.5〜58.5%がこの部分だった。

言語タグが9以下のモデルだけで比べると、日本語は2.03倍で、韓国語(2.11倍)に近く、フランス語・ドイツ語(1.64〜1.65倍)より大きく、中国語(2.82倍)より小さい値だった。2025年1〜8月から2026年1〜8月への伸びでは、前の節で見た順番(中国語が最も速く、韓国語と日本語が続き、フランス語・ドイツ語が続く)は、多言語のモデルを分けても同じだ。

ただし、2024年から2025年への伸びを同じように言語タグ9以下のモデルで見ると、日本語は1.10倍、フランス語は1.13倍でほぼ同じで、韓国語は0.85倍、ドイツ語は0.94倍と前の年より減っていた(中国語は1.72倍)。言語タグ9以下のモデルでは、2025年の伸びは日本語とフランス語でほぼ同じで、どの年も日本語がフランス語より速く増えていたわけではない。

ここから言えるのは、日本語・韓国語・フランス語・ドイツ語の件数の4割以上は、10以上の言語をまとめて対応とするモデルで、その部分がどの言語でも同じように増えている、ということだ。2025年以降、月別のグラフで日本語・韓国語・ドイツ語が重なって動いていたのは、この共通の部分が大きいためと考えられる。中国語は、増加9,186件のうち言語タグ10以上のモデルの分が18.2%で、他の4つとは中身が違った。どんなモデルが増えたのかは、このデータからは確かめていない。

タスクの内訳: 何をするモデルが多いか

モデルの中身も少し見ておく。各モデルの pipeline_tag(何をするモデルか)の割合で、並びは日本語で件数の多い順の上位10だ。

pipeline_tag 日本語(ja) 韓国語(ko) 中国語(zh) フランス語(fr) ドイツ語(de)
text-generation 32.1% 37.1% 34.1% 37.1% 37.1%
(pipeline_tag なし) 30.3% 27.9% 28.0% 23.3% 22.9%
automatic-speech-recognition 7.6% 7.6% 4.7% 6.9% 7.7%
text-to-speech 5.5% 4.6% 3.9% 3.9% 4.7%
image-text-to-text 5.5% 5.0% 10.1% 3.7% 4.0%
translation 4.7% 4.4% 2.9% 7.8% 6.9%
sentence-similarity 2.6% 3.0% 1.3% 2.5% 2.6%
text-classification 1.9% 2.6% 2.1% 3.0% 3.1%
token-classification 1.6% 1.0% 0.9% 4.8% 4.6%
feature-extraction 1.6% 1.6% 1.6% 1.3% 1.4%

どの言語でも、文章を生成するモデル(text-generation)が最も多く、3割台だった。日本語はその割合が32.1%で5つの中で最も低く、pipeline_tag が付いていないモデルの割合(30.3%)は最も高い。

言語ごとの違いが目立ったのは次の3つだ。

  • 音声合成(text-to-speech)は日本語が5.5%で、5つの中で最も高い割合だった。
  • 翻訳(translation)と、単語ごとに分類するモデル(token-classification、固有表現の抽出など)は、フランス語・ドイツ語で高く、日本語はそれぞれ4.7%と1.6%だった。
  • 画像と文章を入力にするモデル(image-text-to-text)は、中国語が10.1%で、他の4つ(3.7〜5.5%)より高い割合だった。

ダウンロード数の集中: 一部のモデルに集まっている

最後に、直近30日のダウンロード数(取得した時点の値)が、どれだけ一部のモデルに集まっているかを見た。

言語タグ 合計 上位10件の割合 上位1%の割合(件数) 0件のモデル 中央値 言語タグ10以上のモデルの割合 上位10件のうち言語タグ10以上
日本語(ja) 246,929,930 53.8% 93.5%(193件) 10.6% 41 80.2% 9件
韓国語(ko) 215,971,515 55.1% 94.3%(179件) 8.4% 28 90.2% 10件
中国語(zh) 270,268,561 28.1% 90.0%(336件) 9.5% 38 56.5% 7件
フランス語(fr) 301,860,535 48.2% 93.6%(230件) 10.5% 26 71.1% 7件
ドイツ語(de) 296,983,723 49.0% 92.9%(204件) 8.7% 28 71.6% 7件

日本語タグのモデルでは、ダウンロード数の上位10件が合計の53.8%、上位1%にあたる193件が93.5%を占めていた。中央値は41回で、10.6%のモデルは直近30日に1回もダウンロードされていない。中国語の上位10件は28.1%で、5つの中では集中の度合いが低めだった。

ここでも、多言語のモデルが大きな部分を占めていた。日本語タグのモデルのダウンロード数のうち80.2%は、10以上の言語タグを持つモデルの分だ。日本語の上位10件のうち9件はそうしたモデルで、韓国語の上位10件とは9件が同じモデルだった(フランス語・ドイツ語とは7件、中国語とは6件)。日本語タグのダウンロード数の合計は、日本語のためだけに使われた回数ではない。

数字を見るときの注意

  • 言語タグは、モデルを公開した人が付けるものだ。 Hugging Face の説明では、言語はモデルカードのメタデータ(language)に書く。日本語に対応していてもタグを付けていないモデルは、この集計に入っていない。反対に、タグが付いていても、その言語でどれだけ使えるかは確かめていない。
  • 3文字の言語コードは数えていない。 Hugging Face の言語の一覧には、ja のほかに jpn(Japanese)があり、同じように kor・zho・fra・deu もある。この記事は2文字のタグ(ja など)で絞ったので、3文字のタグだけが付いたモデルは入っていない。
  • 1つのモデルが複数の言語に数えられている。 5つの言語のどれかのタグを持つモデルは重複を除くと65,001件で、そのうち8,351件は5つすべてのタグを持っている。言語ごとの件数を足しても、モデルの数にはならない。
  • 言語タグ10以上という区切りは、自分で決めたものだ。 区切りを変えると、表の割合も変わる。
  • 作成日時は、Hugging Face 上のリポジトリの作成日時だ。 モデルが発表された日とは限らない。削除されたモデルや非公開のモデルは数えられないので、過去の月ほど、実際に作られた数より少なく出ている可能性がある(どれだけ少ないかは確かめられない)。
  • pipeline_tag は、投稿者が書くほか、自動で付くことがある。 Hugging Face の説明では、transformers のモデルは設定ファイル(config.json)から推定され、モデルカードで書き換えられる。
  • ダウンロード数は、取得した時点の直近30日の値だ。 Hugging Face の説明では、決まったファイル(config.json など)への GET・HEAD のリクエストをダウンロードとして数えている。人が使った回数とは限らず、自動で繰り返し取得する仕組みからの分も入る。
  • 件数やダウンロード数は、モデルの良し悪しを表さない。 この記事は特定のモデルや投稿者を評価するものではない。
  • 取得した時点の値だ。 2026-09-26 の 14:43〜14:57(UTC)に取得した。タグは後から書き換えられるので、別の日に取得すると件数は変わる。

まとめ

日本語タグの付いたモデルは、2023年以降、韓国語とほぼ同じペースで増えていた。フランス語・ドイツ語よりは速く、中国語よりは遅いペースだ。5つの言語の延べ数に占める日本語の割合は、2024年以降17%前後だった。ただし、2025年以降に作られた日本語タグのモデルの4割以上は10以上の言語タグを持つモデルで、その多くは他の言語にも数えられている。言語タグが9以下のモデルだけで比べると、2026年1〜8月の伸びの順番は変わらなかったが、2025年の伸びは日本語とフランス語でほぼ同じだった。

付録A 数えたもの

Hugging Face Hub には、モデルの一覧を返す API(/api/models)がある。ログインしなくても使え、filter=ja のように言語タグを指定すると、そのタグが付いたモデルだけが返る。この記事では、次の条件で5つの言語タグを取得した。

  • 対象: ja(日本語)・ko(韓国語)・zh(中国語)・fr(フランス語)・de(ドイツ語)のタグが付いたモデルの全件。取得日に公開されていたものだけで、削除されたモデルや非公開のモデルは入っていない。
  • 受け取った項目: 作成日時(createdAt)、直近30日のダウンロード数(downloads)、タスク(pipeline_tag)、タグの一覧(tags)など。モデルの説明文(モデルカード)は取得していない。
  • 取得の仕方: 1回に1,000件ずつ、次のページの位置を示す値(cursor)でたどった。モデル一覧の取得は5言語で合計117回だ。匿名での API の上限は5分間に500回(公式の説明、2026-09-26 時点)なので、1回ごとに3秒以上あけて取得した。

作成日時には、扱いに注意が必要な値がある。Hugging Face の Python ライブラリの説明によると、作成日時の最も古い値は 2022-03-02T23:29:04.000Z で、これは作成日の記録を始めた日にあたる。それより前に作られたモデルも、この値になっている。そこで、作成日が2022年3月のモデルは作成月の集計から外し、2022年4月〜2026年8月(UTC) を比べる範囲にした。2026年9月は途中の月なので外している。この決め方は、データを取得する前に決めたものだ。

言語タグ 取得した件数 作成日が2022年4月〜2026年8月 作成日が2022年3月2日(うち記録開始の値) 2022年3月3〜31日 2026年9月1〜26日
日本語(ja) 19,293 18,116 274(67) 9 894
韓国語(ko) 17,944 16,956 177(37) 6 805
中国語(zh) 33,593 30,817 369(70) 18 2,389
フランス語(fr) 23,025 21,643 476(270) 25 881
ドイツ語(de) 20,421 19,161 424(170) 23 813

作成日時が欠けているモデルはなかった。2022年3月2日のモデルのうち、記録開始の値(23:29:04)でないものも、すべてその1秒後(23:29:05)以降の同じ日の時刻だった。

出典