論文紹介: Vision-R1 — マルチモーダル大規模言語モデルに推論能力を促す試み
arXivのプレプリントとして公開された、マルチモーダル大規模言語モデル(MLLM)の推論能力向上に関する論文です。 / DeepSeek-R1-Zeroのような強化学習による推論能力の発現に着想を得て、Vision-R1というモデルを提案しています。 / 人手注釈なしで高品質なマルチモーダルChain-of-Thoughtデータセットを構築し、cold-start用の学習データとして用いています。
論文紹介: PCGRLLM — LLMを使った手続き型コンテンツ生成のための報酬設計
ゲームAIの学習で重要な「報酬設計」を、LLMを使って支援する手法を提案したプレプリントです。 / 既存研究を拡張したPCGRLLMという枠組みを示し、フィードバック機構と推論ベースのプロンプト設計を組み合わせています。 / 2次元環境でのstory-to-reward生成課題に対して、2種類のLLMで評価し、ゼロショット性能に応じて性能改善が報告されています。
論文紹介: LLMとGNNを組み合わせたテキスト・数値グラフ推論の研究
arXiv上のプレプリントとして公開された、テキストと数値の両方を持つグラフを扱う研究です。 / 著者らは、説明文や既知知識と、観測値・活性度のような数値情報を同時に持つ「text-numeric graph(TNG)」を提案しています。 / さらに、LLMとGNNを組み合わせてTNGを解析し、重要な要素の抽出や推論に使う枠組みを示しています。
論文紹介: 大規模言語モデルのアーキテクチャ、ベンチマーク、課題を整理したサーベイ
arXivのプレプリントとして、大規模言語モデル(LLM)とマルチモーダル大規模言語モデル(MLLM)の最近の動向を整理したサーベイ論文です。 / Abstractでは、LLMの進化、MLLMの登場、代表的モデルの比較、技術的特徴、強みと限界、今後の課題が扱われています。 / テキスト生成、翻訳、質問応答、コード生成・解析に加え、画像・音声・動画など複数モダリティを扱う方向性がまとめられています。
論文紹介: LLMでMinecraftの建築計画を立てる「APT」— ブループリント生成と実行を組み合わせたエージェント研究
arXivのプレプリントとして、LLMを使ってMinecraft内の複雑な建築を計画・生成する枠組み「APT」が提案されています。 / ポイントは、画像生成モデルで直接ボクセルを作るのではなく、LLMの空間推論や段階的な分解を使ってブループリントを作る設計です。 / zero-shot / few-shotでの実行、memory・reflectionによる反復 सुधार、複数の構成要素からなるベンチマーク評価が含まれています。
論文紹介: テキストとグラフを組み合わせる分子逆設計モデル「Llamole」
arXivのプレプリントとして、分子設計と逆合成計画に向けた多モーダルLLM「Llamole」を提案する論文です。 / 画像ではなくグラフを扱うLLMの難しさに対して、テキストとグラフを交互に生成できる仕組みを示しています。 / Graph Diffusion TransformerやGraph Neural Networks、A*探索を組み合わせ、分子生成と反応推論を行う点が特徴です。
論文紹介: Cog-GA — 連続環境の視覚言語ナビゲーション向け生成エージェント
arXivのプレプリントとして公開された、視覚言語ナビゲーション(VLN-CE)向けの研究です。 / LLMを基盤にした生成エージェント「Cog-GA」を提案し、認知地図、次の移動先予測、振り返り機構を組み合わせる方法が示されています。 / abstractでは、環境の手がかりを「what」「where」に分けた説明を使う点や、継続的な学習・再計画を支える仕組みが述べられています。
論文紹介: 大規模言語モデルの知識を積み上げてGNN設計を支援する「DesiGNN」
arXivのプレプリントとして公開された、Graph Neural Network(GNN)設計支援に関する論文です。 / LLMは一般的な推論は得意でも、グラフの性質に応じたGNN設計のような専門性の高い作業では難しさがある、と論文では説明されています。 / 提案手法DesiGNNは、過去の設計経験を知識として整理し、LLMに適した形で活用する枠組みとされています。
論文紹介: 少数ラベル環境でGNNを強化するためにLLMから知識を積極的に蒸留する手法
arXivのプレプリントとして公開された、グラフニューラルネットワーク(GNN)と大規模言語モデル(LLM)を組み合わせる研究です。 / 少数のラベルしかないノード分類で、LLMのゼロショット推論や推論能力を活かしてGNNの性能向上を狙っています。 / 著者らはGraph-LLMベースのactive learningパラダイムを提案し、限られたラベルデータでの精度改善を報告しています。
論文紹介: LatentExplainer — 深層生成モデルの潜在表現をMLLMで説明する手法
深層生成モデルの潜在変数を、意味のある説明文として自動生成する枠組みを提案しています。 / 潜在変数の意味推定、説明とモデルの帰納バイアスの整合、説明可能性の度合いの違いへの対応が主な課題として挙げられています。 / 潜在変数を摂動し、生成結果の変化を見ながら、マルチモーダル大規模言語モデルで説明を作る方法が示されています。
