Hugging Face の日本語タグのモデルは、他の言語と同じペースで増えているのか。5言語の全件を作成月で数えた
AI のモデルを公開・共有するサイトの Hugging Face には、モデルごとに対応する言語のタグを付けられる。日本語のタグ(ja)が付いたモデルは、2026年9月26日の時点で19,293件あった。同じ日に数えた中国語(zh)は33,593件、フランス語(fr)は23,025件だ。では、日本語タグのモデルは、他の言語と同じペースで増えているのか。
先に答えを書く。日本語タグのモデルは、韓国語とほぼ同じペースで増えていた。フランス語・ドイツ語よりは速く、中国語よりは遅い。 5つの言語の延べ数に占める日本語の割合は、2024年以降17%前後でほとんど変わっていない。ただし、この数字には注意がいる。2025年以降に作られた日本語タグのモデルの4割以上は、10以上の言語タグを持つ「多言語のモデル」で、その多くは他の言語にも数えられている。
この記事で確かめたのは、日本語タグの付いたモデルは、他の言語と同じペースで増えているのか、という点だ。日本語・韓国語・中国語・フランス語・ドイツ語の5つの言語タグについて、Hugging Face の API でモデルを全件取得し、作成された年・月ごとに数えて比べた。あわせて、タスクの内訳とダウンロード数の集中も見ている。データの取得日は 2026-09-26(UTC)だ。比べる範囲は 2022年4月〜2026年8月(UTC) で、その決め方と取得の条件は、記事の終わりの付録Aにまとめた。
作成年別に数えると、5つの言語とも増えている
まず、作成年ごとの件数を見てみよう。表は、作成年ごとの件数と、前の年との比だ。2026年は8月までなので、最後の列は2025年と2026年の1〜8月どうしで比べている。
| 言語タグ | 2022年(4〜12月) | 2023年 | 2024年 | 2025年 | 2026年(1〜8月) | 2024年÷2023年 | 2025年÷2024年 | 2026年1〜8月÷2025年1〜8月 |
|---|---|---|---|---|---|---|---|---|
| 日本語(ja) | 252 | 1,237 | 3,684 | 5,282 | 7,661 | 2.98倍 | 1.43倍 | 2.10倍 |
| 韓国語(ko) | 180 | 1,114 | 3,902 | 4,747 | 7,013 | 3.50倍 | 1.22倍 | 2.16倍 |
| 中国語(zh) | 392 | 2,023 | 4,689 | 8,707 | 15,006 | 2.32倍 | 1.86倍 | 2.58倍 |
| フランス語(fr) | 542 | 1,795 | 4,601 | 6,544 | 8,161 | 2.56倍 | 1.42倍 | 1.83倍 |
| ドイツ語(de) | 360 | 1,501 | 4,366 | 5,639 | 7,295 | 2.91倍 | 1.29倍 | 1.84倍 |
2023年以降、5つの言語とも、前の年より多くのモデルが作られていた。日本語は、2024年が2023年の2.98倍、2025年が2024年の1.43倍、2026年1〜8月が前の年の同じ期間の2.10倍だ。
伸び方を比べやすくするため、日本語の件数を他の言語の件数で割った値も出した。この値が年によって変わらなければ、日本語はその言語と同じペースで増えていることになる。
| 比べる相手 | 2022年(4〜12月) | 2023年 | 2024年 | 2025年 | 2026年(1〜8月) |
|---|---|---|---|---|---|
| 日本語 ÷ 韓国語(ko) | 1.40 | 1.11 | 0.94 | 1.11 | 1.09 |
| 日本語 ÷ 中国語(zh) | 0.64 | 0.61 | 0.79 | 0.61 | 0.51 |
| 日本語 ÷ フランス語(fr) | 0.46 | 0.69 | 0.80 | 0.81 | 0.94 |
| 日本語 ÷ ドイツ語(de) | 0.70 | 0.82 | 0.84 | 0.94 | 1.05 |
| 5言語の延べ数に占める日本語 | 14.6% | 16.1% | 17.3% | 17.1% | 17.0% |
最初の問いへの答えは、比べる相手によって分かれた。
- 韓国語とは、ほぼ同じペースだ。 2023年以降、日本語 ÷ 韓国語は 0.94〜1.11 の間だった。
- フランス語・ドイツ語よりは速く増えている。 日本語 ÷ フランス語は2023年の0.69から2026年1〜8月の0.94に、日本語 ÷ ドイツ語は0.82から1.05に上がった。2026年1〜8月は、日本語タグのモデルの数がドイツ語を上回っている。
- 中国語よりは遅く増えている。 日本語 ÷ 中国語は2024年の0.79から、2026年1〜8月は0.51に下がった。2026年1〜8月の伸びは、中国語が2.58倍で、5つの中で最も大きい値だ。
5つの言語の延べ数に占める日本語の割合は、2024年以降17.0〜17.3%で、ほとんど変わっていない。
月別に並べると、山が同じ月に来る
年別だけでは、増え方の細かい形が見えない。そこで、月別の推移も見てみよう。作成月別の件数の推移で、2023年8月以降を並べた。フランス語はドイツ語とほぼ同じ形のため、グラフには入れていない。
2025年以降は、日本語・韓国語・ドイツ語の3本がほとんどの月で重なるように動いている(2025年1月〜2026年8月の20か月のうち18か月は、3つのうち最も多い言語の件数が、最も少ない言語の1.5倍以内だった)。2024年までは、ドイツ語や韓国語が日本語の1.5倍を超える月もあり、3つの言語の件数が1.5倍以内に収まったのは2023年8月〜2024年12月の17か月のうち8か月だった。件数が大きく増えた月も4つの言語でそろっていて、2025年12月と2026年3月は、どの言語もその前の月より増えた。中国語は2025年2月以降、どの月も他の3つより多く、2026年3月以降は2倍前後の件数だ。2026年8月の件数は、中国語2,778件、日本語1,322件、ドイツ語1,292件、韓国語1,123件だった。
言語の違うモデルが、同じ月にそろって増えたり減ったりしているのはなぜか。それを見るため、1つのモデルに付いている言語タグの数を数えた。
件数の中身: 同じモデルが、いくつもの言語に数えられている
1つのモデルには、言語タグをいくつでも付けられる。そこで、各モデルの tags のうち、Hugging Face の言語の一覧にある2文字のコード(en・ja など)がいくつ付いているかを数えた。
| 言語タグ | 2文字の言語タグがその言語だけ | en も付いている | 2文字の言語タグが10以上 | 2文字の言語タグの数(中央値) |
|---|---|---|---|---|
| 日本語(ja) | 3,876(20.1%) | 15,029(77.9%) | 7,529(39.0%) | 8 |
| 韓国語(ko) | 3,930(21.9%) | 13,815(77.0%) | 7,490(41.7%) | 8 |
| 中国語(zh) | 4,418(13.2%) | 28,752(85.6%) | 8,010(23.8%) | 2 |
| フランス語(fr) | 3,337(14.5%) | 18,977(82.4%) | 8,920(38.7%) | 8 |
| ドイツ語(de) | 2,436(11.9%) | 17,532(85.9%) | 8,617(42.2%) | 8 |
日本語タグのモデルのうち、言語タグが日本語だけのものは20.1%だった。反対に、39.0%(7,529件)は10以上の言語タグを持っている。この7,529件のうち89.4%は、5つの言語のタグをすべて持っていた。日本語・韓国語・フランス語・ドイツ語では、4割前後のモデルが「10以上の言語に対応」とされたモデルだ。5つの言語すべてで、この「10以上」に入っているモデルは6,734件あり、4つの言語の「10以上」の多くは同じモデルになる。中国語だけは、10以上のモデルが23.8%と少なく、言語タグの数の中央値も2だった。
この10以上の言語タグを持つモデルの割合を、作成年別に見た。日本語・韓国語・フランス語・ドイツ語では2025年に大きく上がり、中国語は2024〜2026年も2割台(23.8%・29.2%・22.4%)だった。
| 言語タグ | 2022年(4〜12月) | 2023年 | 2024年 | 2025年 | 2026年(1〜8月) |
|---|---|---|---|---|---|
| 日本語(ja) | 22.2% | 23.3% | 27.1% | 44.0% | 43.7% |
| 韓国語(ko) | 31.7% | 24.0% | 26.1% | 48.4% | 47.5% |
| 中国語(zh) | 22.7% | 16.9% | 23.8% | 29.2% | 22.4% |
| フランス語(fr) | 19.9% | 20.1% | 26.9% | 42.0% | 47.0% |
| ドイツ語(de) | 17.2% | 21.8% | 27.7% | 47.4% | 51.3% |
日本語では、2024年に作られたモデルの27.1%だったのが、2025年は44.0%、2026年1〜8月は43.7%になった。2025年以降に作られた日本語タグのモデルは、4割以上が10以上の言語タグを持つモデルだ。
では、10以上の言語タグを持つモデルと、9以下のモデルに分けると、伸び方はどう違うのか。2025年1〜8月から2026年1〜8月への増え方を分けて数えた。
| 言語タグ | 2025年1〜8月→2026年1〜8月の増加 | うち言語タグ10以上のモデルの分 | 言語タグ10以上の伸び | 言語タグ9以下の伸び |
|---|---|---|---|---|
| 日本語(ja) | 4,013 | 1,820(45.4%) | 2.19倍(1,527→3,347) | 2.03倍(2,121→4,314) |
| 韓国語(ko) | 3,767 | 1,826(48.5%) | 2.21倍(1,505→3,331) | 2.11倍(1,741→3,682) |
| 中国語(zh) | 9,186 | 1,671(18.2%) | 1.98倍(1,697→3,368) | 2.82倍(4,123→11,638) |
| フランス語(fr) | 3,692 | 1,987(53.8%) | 2.08倍(1,848→3,835) | 1.65倍(2,621→4,326) |
| ドイツ語(de) | 3,331 | 1,948(58.5%) | 2.09倍(1,793→3,741) | 1.64倍(2,171→3,554) |
日本語タグのモデルの増加4,013件のうち、45.4%は10以上の言語タグを持つモデルの分だった。この部分は、どの言語でも1.98〜2.21倍で、ほぼ同じ伸びだ。韓国語・フランス語・ドイツ語でも、増加の48.5〜58.5%がこの部分だった。
言語タグが9以下のモデルだけで比べると、日本語は2.03倍で、韓国語(2.11倍)に近く、フランス語・ドイツ語(1.64〜1.65倍)より大きく、中国語(2.82倍)より小さい値だった。2025年1〜8月から2026年1〜8月への伸びでは、前の節で見た順番(中国語が最も速く、韓国語と日本語が続き、フランス語・ドイツ語が続く)は、多言語のモデルを分けても同じだ。
ただし、2024年から2025年への伸びを同じように言語タグ9以下のモデルで見ると、日本語は1.10倍、フランス語は1.13倍でほぼ同じで、韓国語は0.85倍、ドイツ語は0.94倍と前の年より減っていた(中国語は1.72倍)。言語タグ9以下のモデルでは、2025年の伸びは日本語とフランス語でほぼ同じで、どの年も日本語がフランス語より速く増えていたわけではない。
ここから言えるのは、日本語・韓国語・フランス語・ドイツ語の件数の4割以上は、10以上の言語をまとめて対応とするモデルで、その部分がどの言語でも同じように増えている、ということだ。2025年以降、月別のグラフで日本語・韓国語・ドイツ語が重なって動いていたのは、この共通の部分が大きいためと考えられる。中国語は、増加9,186件のうち言語タグ10以上のモデルの分が18.2%で、他の4つとは中身が違った。どんなモデルが増えたのかは、このデータからは確かめていない。
タスクの内訳: 何をするモデルが多いか
モデルの中身も少し見ておく。各モデルの pipeline_tag(何をするモデルか)の割合で、並びは日本語で件数の多い順の上位10だ。
| pipeline_tag | 日本語(ja) | 韓国語(ko) | 中国語(zh) | フランス語(fr) | ドイツ語(de) |
|---|---|---|---|---|---|
text-generation |
32.1% | 37.1% | 34.1% | 37.1% | 37.1% |
| (pipeline_tag なし) | 30.3% | 27.9% | 28.0% | 23.3% | 22.9% |
automatic-speech-recognition |
7.6% | 7.6% | 4.7% | 6.9% | 7.7% |
text-to-speech |
5.5% | 4.6% | 3.9% | 3.9% | 4.7% |
image-text-to-text |
5.5% | 5.0% | 10.1% | 3.7% | 4.0% |
translation |
4.7% | 4.4% | 2.9% | 7.8% | 6.9% |
sentence-similarity |
2.6% | 3.0% | 1.3% | 2.5% | 2.6% |
text-classification |
1.9% | 2.6% | 2.1% | 3.0% | 3.1% |
token-classification |
1.6% | 1.0% | 0.9% | 4.8% | 4.6% |
feature-extraction |
1.6% | 1.6% | 1.6% | 1.3% | 1.4% |
どの言語でも、文章を生成するモデル(text-generation)が最も多く、3割台だった。日本語はその割合が32.1%で5つの中で最も低く、pipeline_tag が付いていないモデルの割合(30.3%)は最も高い。
言語ごとの違いが目立ったのは次の3つだ。
- 音声合成(
text-to-speech)は日本語が5.5%で、5つの中で最も高い割合だった。 - 翻訳(
translation)と、単語ごとに分類するモデル(token-classification、固有表現の抽出など)は、フランス語・ドイツ語で高く、日本語はそれぞれ4.7%と1.6%だった。 - 画像と文章を入力にするモデル(
image-text-to-text)は、中国語が10.1%で、他の4つ(3.7〜5.5%)より高い割合だった。
ダウンロード数の集中: 一部のモデルに集まっている
最後に、直近30日のダウンロード数(取得した時点の値)が、どれだけ一部のモデルに集まっているかを見た。
| 言語タグ | 合計 | 上位10件の割合 | 上位1%の割合(件数) | 0件のモデル | 中央値 | 言語タグ10以上のモデルの割合 | 上位10件のうち言語タグ10以上 |
|---|---|---|---|---|---|---|---|
| 日本語(ja) | 246,929,930 | 53.8% | 93.5%(193件) | 10.6% | 41 | 80.2% | 9件 |
| 韓国語(ko) | 215,971,515 | 55.1% | 94.3%(179件) | 8.4% | 28 | 90.2% | 10件 |
| 中国語(zh) | 270,268,561 | 28.1% | 90.0%(336件) | 9.5% | 38 | 56.5% | 7件 |
| フランス語(fr) | 301,860,535 | 48.2% | 93.6%(230件) | 10.5% | 26 | 71.1% | 7件 |
| ドイツ語(de) | 296,983,723 | 49.0% | 92.9%(204件) | 8.7% | 28 | 71.6% | 7件 |
日本語タグのモデルでは、ダウンロード数の上位10件が合計の53.8%、上位1%にあたる193件が93.5%を占めていた。中央値は41回で、10.6%のモデルは直近30日に1回もダウンロードされていない。中国語の上位10件は28.1%で、5つの中では集中の度合いが低めだった。
ここでも、多言語のモデルが大きな部分を占めていた。日本語タグのモデルのダウンロード数のうち80.2%は、10以上の言語タグを持つモデルの分だ。日本語の上位10件のうち9件はそうしたモデルで、韓国語の上位10件とは9件が同じモデルだった(フランス語・ドイツ語とは7件、中国語とは6件)。日本語タグのダウンロード数の合計は、日本語のためだけに使われた回数ではない。
数字を見るときの注意
- 言語タグは、モデルを公開した人が付けるものだ。 Hugging Face の説明では、言語はモデルカードのメタデータ(
language)に書く。日本語に対応していてもタグを付けていないモデルは、この集計に入っていない。反対に、タグが付いていても、その言語でどれだけ使えるかは確かめていない。 - 3文字の言語コードは数えていない。 Hugging Face の言語の一覧には、
jaのほかにjpn(Japanese)があり、同じようにkor・zho・fra・deuもある。この記事は2文字のタグ(jaなど)で絞ったので、3文字のタグだけが付いたモデルは入っていない。 - 1つのモデルが複数の言語に数えられている。 5つの言語のどれかのタグを持つモデルは重複を除くと65,001件で、そのうち8,351件は5つすべてのタグを持っている。言語ごとの件数を足しても、モデルの数にはならない。
- 言語タグ10以上という区切りは、自分で決めたものだ。 区切りを変えると、表の割合も変わる。
- 作成日時は、Hugging Face 上のリポジトリの作成日時だ。 モデルが発表された日とは限らない。削除されたモデルや非公開のモデルは数えられないので、過去の月ほど、実際に作られた数より少なく出ている可能性がある(どれだけ少ないかは確かめられない)。
pipeline_tagは、投稿者が書くほか、自動で付くことがある。 Hugging Face の説明では、transformersのモデルは設定ファイル(config.json)から推定され、モデルカードで書き換えられる。- ダウンロード数は、取得した時点の直近30日の値だ。 Hugging Face の説明では、決まったファイル(
config.jsonなど)への GET・HEAD のリクエストをダウンロードとして数えている。人が使った回数とは限らず、自動で繰り返し取得する仕組みからの分も入る。 - 件数やダウンロード数は、モデルの良し悪しを表さない。 この記事は特定のモデルや投稿者を評価するものではない。
- 取得した時点の値だ。 2026-09-26 の 14:43〜14:57(UTC)に取得した。タグは後から書き換えられるので、別の日に取得すると件数は変わる。
まとめ
日本語タグの付いたモデルは、2023年以降、韓国語とほぼ同じペースで増えていた。フランス語・ドイツ語よりは速く、中国語よりは遅いペースだ。5つの言語の延べ数に占める日本語の割合は、2024年以降17%前後だった。ただし、2025年以降に作られた日本語タグのモデルの4割以上は10以上の言語タグを持つモデルで、その多くは他の言語にも数えられている。言語タグが9以下のモデルだけで比べると、2026年1〜8月の伸びの順番は変わらなかったが、2025年の伸びは日本語とフランス語でほぼ同じだった。
付録A 数えたもの
Hugging Face Hub には、モデルの一覧を返す API(/api/models)がある。ログインしなくても使え、filter=ja のように言語タグを指定すると、そのタグが付いたモデルだけが返る。この記事では、次の条件で5つの言語タグを取得した。
- 対象:
ja(日本語)・ko(韓国語)・zh(中国語)・fr(フランス語)・de(ドイツ語)のタグが付いたモデルの全件。取得日に公開されていたものだけで、削除されたモデルや非公開のモデルは入っていない。 - 受け取った項目: 作成日時(
createdAt)、直近30日のダウンロード数(downloads)、タスク(pipeline_tag)、タグの一覧(tags)など。モデルの説明文(モデルカード)は取得していない。 - 取得の仕方: 1回に1,000件ずつ、次のページの位置を示す値(cursor)でたどった。モデル一覧の取得は5言語で合計117回だ。匿名での API の上限は5分間に500回(公式の説明、2026-09-26 時点)なので、1回ごとに3秒以上あけて取得した。
作成日時には、扱いに注意が必要な値がある。Hugging Face の Python ライブラリの説明によると、作成日時の最も古い値は 2022-03-02T23:29:04.000Z で、これは作成日の記録を始めた日にあたる。それより前に作られたモデルも、この値になっている。そこで、作成日が2022年3月のモデルは作成月の集計から外し、2022年4月〜2026年8月(UTC) を比べる範囲にした。2026年9月は途中の月なので外している。この決め方は、データを取得する前に決めたものだ。
| 言語タグ | 取得した件数 | 作成日が2022年4月〜2026年8月 | 作成日が2022年3月2日(うち記録開始の値) | 2022年3月3〜31日 | 2026年9月1〜26日 |
|---|---|---|---|---|---|
| 日本語(ja) | 19,293 | 18,116 | 274(67) | 9 | 894 |
| 韓国語(ko) | 17,944 | 16,956 | 177(37) | 6 | 805 |
| 中国語(zh) | 33,593 | 30,817 | 369(70) | 18 | 2,389 |
| フランス語(fr) | 23,025 | 21,643 | 476(270) | 25 | 881 |
| ドイツ語(de) | 20,421 | 19,161 | 424(170) | 23 | 813 |
作成日時が欠けているモデルはなかった。2022年3月2日のモデルのうち、記録開始の値(23:29:04)でないものも、すべてその1秒後(23:29:05)以降の同じ日の時刻だった。
出典
- Hugging Face Hub の API(
/api/models?filter=jaなど5つの言語タグの全件、/api/models-tags-by-typeの言語の一覧、取得日: 2026-09-26)。件数・割合はすべて自分で集計したもの。 - Hugging Face Hub のドキュメント「Hub API Endpoints」(取得日: 2026-09-26)
- Hugging Face Hub のドキュメント「Hub Rate limits」(匿名での API の上限が5分間に500回、取得日: 2026-09-26)
- huggingface_hub のドキュメント「HfApi Client」(ModelInfo の created_at の最も古い値、downloads が直近30日であること、取得日: 2026-09-26)
- Hugging Face Hub のドキュメント「Models Download Stats」(ダウンロード数の数え方、取得日: 2026-09-26)
- Hugging Face Hub のドキュメント「Model Cards」(language のメタデータ、pipeline_tag の指定と推定、取得日: 2026-09-26)