MiniMax-H3は物理世界を推論できるか――4種のオムニモーダル評価
映像・画像・音声の断片を組み合わせても成功率は41.97%。MiniMax-H3の「入力できる」と「推論に使える」の隔たりを測る
Hugging Faceの注目論文を中心に、論文になる前の重要な技術発表も厳選。語彙と読む深さを選び、肝のアイデアから評価設計、限界まで理解できます。このサイトについて →
映像・画像・音声の断片を組み合わせても成功率は41.97%。MiniMax-H3の「入力できる」と「推論に使える」の隔たりを測る
異なるEOS表現を一つの停止行動として学習するSemantic EOS Aggregation
型付きの選択肢と確率を並列に返すJevは、言語モデルとは異なる自動化の入口になりうるか
自己申告の確信度を過去の成功率で補正し、回答・再試行・委任の判断につなげる
具体的な採点基準が攻撃の手掛かりになる—ImpossibleRubricsが示す生成ルーブリックの盲点
7.39Bモデルは長文脈・段階学習・外部ツールで容量制約をどこまで補えるか
比較できないスコアを無理に束ねず、評価の根拠までたどれる「生きた」ベンチマーク台帳
Marigold V2は生成用DiTを単一ステップの高精細な深度推定器へ変える
プロンプト保護と推論トレースの冗長性に着目し、スコア計算なしで同等精度とスループット32〜43%向上を達成
分断されたターミナルやチャットを統合し、人間が追試・復元可能なAI研究基盤をオープンソースで実現
実機サンドボックス実行の壁を仮想世界モデルで打破し、研究AIの学習を3〜4倍高速化
195万時間の音声データとFlow Matchingにより、生成と編集を単一基盤モデルに統合
推論能力を獲得した知性が自律エージェントや自己進化へと跳躍を試みる現在進行形の年。日々の研究は活発に発表されているものの、過去の原典のように『世界の前提を不可逆的に決定づけた』と断定できる不朽のブレイクスルーはまだ見極めの途上にあり、次なる新パラダイムの決定打を待望する過渡期に位置づけられます。
純粋強化学習による自己反省と「ひらめき」の創発。巨大独占の厚い壁を打ち破り、推論モデルの知性そのものがオープンソースコミュニティへと解放された歴史的転換点。
生成AIの商用化が爆発した一方、メガテック各社によるモデルの非公開化(技術詳細を伏せたSystem Card化)が加速。他の年に見られるような『世界の前提を不可逆に変えるオープンなイノベーション原典』が表舞台に登場しなかった特異な年です。既存Transformerのスケーリング限界が議論される水面下で、次なる推論革命への静かな助走が進みました。
限られたメガテックの独占物だった巨大言語モデルを、効率的な計算設計によって研究コミュニティへ解放。世界中のオープンソースAIエコシステムを爆発させた震源地。
潜在空間拡散モデルによる画像生成の民主化と、人間に寄り添うアライメント技術(RLHF)の確立。生成AIが専門家のツールから万人の対話・創作の相棒へと変貌を遂げた決定打。
人間の意図にモデルを揃えるRLHFを確立し、ChatGPT誕生を決定づけたアライメントの原典
拡散プロセスを低次元潜在空間に移行しコンシューマGPUでの高解像度生成を可能にしたStable Diffusionの原典
ノーベル賞へと至るタンパク質立体構造予測(科学AI)の奇跡と、言語と視覚の埋め込みを対照学習で統一したCLIP。ディープラーニングが自然科学とマルチモーダルの新地平を拓いた特異点。
50年来のタンパク質立体構造予測問題を原子分解能で解きノーベル化学賞を受賞した科学AIの頂点
重み更新の低ランク分解により、巨大LLMの省メモリ・高速チューニングを民主化した世界標準
自然言語監督による対照学習で視覚と言語の共通空間を構築しゼロショット画像認識を確立した原典
計算資源と知能の普遍的スケーリング則の実証、そして巨大化による「創発」とFew-Shot学習の発見。現代の大規模言語モデル開発競争のゴングを鳴らした年。
前年のTransformerとBERTの衝撃を受け、世界中が派生モデルの洗練や内部メカニズム解析(BERTology)に熱中した過渡期。他の年のように新たな構造の跳躍が起きるというよりは、来るべき巨大モデル時代へ向けた地盤固めと工学的検証に注力された1年でした。
文脈を左右双方向から捉える事前学習と、下流タスクへのファインチューニングという普遍的パラダイムを確立。自然言語処理に「ImageNetモーメント」をもたらした原点。
再帰も畳み込みも捨て去り、「注意(Self-Attention)」のみで世界のパターンを捉えるアーキテクチャ。以後の言語、画像、音声、あらゆる知能の共通言語となった絶対の祖。
深層学習とモンテカルロ木探索の融合による人類最強棋士の撃破。世界に「AIが人間の直観を超える」衝撃を不可逆的に刻んだ現代AIブームの真の起爆剤。
勾配消失により数十層が限界だったニューラルネットワークに「残差(Skip Connection)」を導入し、152層の深宇宙を拓いた原典。現代の全ディープラーニングモデルの構造的祖先。
わずか1,000件の思考データと推論時待った(budget forcing)だけで、巨額強化学習なしにOpenAI o1互換の自己反省推論を再現した超軽量オープン推論モデル
671B総パラメータ(活性化37B)をわずか557万ドルの事前学習コストで達成。MLAとDeepSeekMoE、FP8混合精度で業界を震撼させたオープンフラッグシップ
0.5Bから72Bまで同一アーキテクチャで網羅。18兆トークン事前学習と合成データ強化学習により、オープンソースLLMの標準的到達点を大幅に押し上げた決定打
アイデア着想、実験設計・実行、可視化、論文執筆、査読まで全プロセスを完全自律化。1論文あたり15ドルの計算コストで研究サイクルを回す自律エージェントの新地平
全47Bパラメータ中トークンあたり13Bのみ活性化。Llama 2 70BやGPT-3.5を凌駕する推論速度と性能を両立したオープンMoEの決定版
複雑な強化学習(PPO)や明示的な報酬モデルを全廃し、単純なクロスエントロピー損失で人間の選好に言語モデルを直接整列させるアライメント革命
Multi-Head Attentionの表現力とMulti-Query Attentionの高速推論・省KVキャッシュを補間し、現代LLMのデファクトとなったグループドクエリアテンション
GPT-4で生成した画像・指示対データセットと単純な線形射影層だけで、LLaMAに世界最高峰の画像対話能力を授けた現代マルチモーダルLLMのひな型
インターネット上の68万時間の音声と弱ラベルテキストを事前学習。方言や環境ノイズをものともせず文字起こしと翻訳の常識を塗り替えた音声界のTransformer
「思考(Thought)」と「行動(Action/Observation)」のループ構造により、幻覚を抑え外部ツールと対話する現代AIエージェントの基盤パラダイムを確立
GPUメモリ階層(SRAMとHBM)間のデータ転送ボトルネックに着目し、タイリングとオンラインSoftmaxによりアテンション行列を保持せず2〜4倍高速化を達成
Kaplanらの従来則を修正し、計算量増加に伴いパラメータ数とデータセットトークン数を等しい比率でスケールさせるべきであることを実証した現代LLM設計の教義
「段階的に考えてみましょう」。中間の思考ステップを自然言語で例示するだけで、数理・論理タスクの推論精度を爆発的に引き出した現代プロンプティングの原点
複素数平面での回転行列を用い、絶対位置埋め込みをアテンション内積の相対位置関係へと自然に変換する現代LLMのデファクトスタンダード