国立情報学研究所(NII)は9月28日、国産の大規模言語モデル「LLM-jp-4.1」を3モデルまとめて公開した。柱は数学・科学分野の強化、外部ツールを呼び出す機能への対応、回答の簡潔化の3点で、ライセンスは商用利用もできるApache 2.0だ。海外の最先端モデルを性能で抜いたという話ではない。中身を説明できる日本製AIが「実務で使える段階」に一歩進んだことに、今回の公開の意味がある。

LLM-jp-4.1の3モデルと公開条件

公開されたのは、約86億パラメータの「8b」、約320億パラメータでMoE(混合エキスパート)構造の「32b-a3b」、約332億パラメータの「33b」の3つで、いずれも考えてから答えるThinkingモデルだ。2026年4月から順に公開されてきたLLM-jp-4シリーズの事後学習を改良したもので、数学、科学、指示への追従で同規模の従来モデルを上回ったとNIIは説明している。(国立情報学研究所 大規模言語モデル研究開発センター)比較的軽い8bから大きめの33bまでそろったことで、使う側は用途に合わせて選べるようになった。

LLM-jp-4.1のツール呼び出しで何が変わるか

いちばん大きな変化はツール呼び出しへの対応だ。AIが検索や計算、社内システムといった外部の道具を自分で呼び出して作業を進める仕組みで、複数の道具を同時に使う並列呼び出しや、何段階かに分けて考える使い方にも対応した。評価では、英語の単発のやり取りでは中国Alibabaの「Qwen」系と同等、日本語で何往復もするやり取りでは優位な結果が出たという。(LLM-jp)いまのAI競争はエージェント、つまり人の代わりに作業をこなす使い方が主戦場だ。道具を使えないモデルは、その土俵にすら上がれない。国産LLMはようやく参加資格を得たと言える。

回答を約半分に縮めた「簡潔さ」の改良

地味だが実用面で効くのが回答の短さだ。一般的な質問では、必要な情報を残したまま回答の長さを約半分に縮めた。教師あり学習の量を約3倍の約350億トークンに増やし、数学系のデータは約15倍、STEM系は約6倍に拡大している。日本語の安全性を測る評価「AnswerCarefully」でも、スコアが3.79から4.08に上がった。回答が長ければ、それだけ計算費用も読む時間もかかる。簡潔さの改良は、研究用のモデルを現場向けに仕立て直した証拠だ。

国産LLMを公費で作り続ける理由

8月には約332億パラメータの「LLM-jp-4 33B」が公開され、日英のMT-Benchなど4つの評価すべてでOpenAIの公開モデル「gpt-oss-20b」を上回ったと報じられた。(ITmedia AI+)ただし、国産LLMの価値は順位にあるわけではない。NIIは今回、学習に使った指示データも公開する予定だ。どんなデータで鍛えたかを外部が検証できるAIは、行政や医療、教育のように「なぜその答えになったのか」を説明しなければならない分野で強みになる。海外の巨大モデルが中身を明かさない以上、この役割は自前で持つしかない。

LLM-jp-4.1で次に問われるのは「使われ方」

今後は東京大学のmdx-MaaSを通じて、研究者向けにAPIとチャットの試験提供が予定されている。(PC Watch)利用者の募集は10月中旬に始まる見込みで、次の「LLM-jp-4.2」の開発も進んでいる。LLM-jp-4.1は、ベンチマークの点数ではなく、どれだけの研究や業務に組み込まれるかで評価されるべきモデルだ。道具を使え、短く答え、中身を説明できる。この3つがそろったいま、国産LLMは「作ること」より「使われること」を目標にする段階に入った。

あわせて読みたい:政府が国産AIを選び直した夏──「源内」がさくらのクラウドで動き出した本当の狙い

参照ソース(噂の出どころ)

大規模言語モデル「LLM-jp-4.1」シリーズを公開(国立情報学研究所 大規模言語モデル研究開発センター/26/09/28)

LLM-jp-4.1 モデルの公開(LLM-jp/26/09/28)

NII、ツール呼び出し対応・STEM強化の「LLM-jp-4.1」公開(PC Watch/26/09/29)

「オープンな国産モデル」に33Bパラメータの新バージョン 国立情報学研究所(ITmedia AI+/26/08/19)

コメントを残す

Trending