論文紹介: 音声駆動の3D talking headで口形状を改善する「PD-GS」
3D Gaussian Splatting を使った音声駆動の talking head 生成に関する新しいプレプリントです。 / 要旨では、口の動きがなめらかになりすぎて、唇を閉じるような細かな発音が崩れやすい点が課題として挙げられています。 / 音声の連続的な表現から短い発音イベントを推定する難しさに着目し、口の形をより自然に保つ工夫が示唆されています。
論文紹介: Woodpecker Distillation — 弱いモデルで強いモデルの推論の“ほころび”を見つける手法
arXivで公開された新着プレプリントで、LLMの推論失敗を「全体的な能力不足」ではなく、途中段階の局所的な誤りとして捉える考え方が示されています。 / 弱いプローブモデルが生成した短い補正パッチを、強いモデルの推論途中に挿入すると、正しい解答側へ進み直せる場合があると要旨では述べられています。 / ただし、こうした補正効果をそのまま直接の微調整で安定して学習できるとは限らないとされています。
論文紹介: イベントに基づく個人メモリ評価ベンチマーク「FinPerMA」
LLMエージェントが、長い期間にわたってユーザーごとの好みや状況を保ちながら更新できるかを評価するベンチマークが提案されています。 / 既存の個人メモリ評価は、事実の記憶確認に偏るか、モデル生成の軌跡に強く依存していたと説明されています。 / FinPerMAは、イベントに基づく形で個人メモリを評価する点が特徴とされています。
論文紹介: 消費者向けGPUで動かすローカルLLMの消費電力を比べた予備的ベンチマーク
ローカル環境でのLLM実行は、プライバシーやオンプレミス利用の観点から注目されています。 / このプレプリントは、消費者向けGPU上で9つのオープンソースLLMの消費電力を、同じ条件で比較した予備的な定量評価を示しています。 / 評価では、RTX 4060Ti 16GB、Ollama、nvidia-smiによる2Hzサンプリング、固定プロンプト सेटが使われたと説明されています。
論文紹介: SME向けの誤情報対策にRAGをどう使うかを扱う新着プレプリント
小規模・中規模企業でのLLM活用において、誤情報につながる幻覚の問題をどう抑えるかがテーマです。 / 外部知識を取り込むRAGを使い、文脈に合った知識で回答精度や信頼性を高める方向性が示されています。 / 要旨の範囲では、SMEの意思決定支援や質問応答での利用を想定した分析だと読み取れます。
論文紹介: AIの安全性をめぐる古典的思考実験を再検討した研究ノート
arXivの新着プレプリントとして、レイプニッツの「機械」、チューリングの模倣ゲーム、サールの中国語の部屋を、Conservation-Congruent Encoding(CCE)という枠組みで見直した研究ノートです。 / 要旨によると、タスク性能を表す指標と、内部構造がその性能をどれだけ保っているかを表す指標を区別する、簡略化された記号的な設定を定式化しています。 / 単純な検索型の仕組みとコンパクトな生成型の仕組みが、行動面では似た成果を示しうる一方で、内部の構造と働き方には違いがある、という問題意識がうかがえます。
論文紹介: 自然言語だけでOpenFOAMのシミュレーションを作成・評価・反復する自律エージェント AutoFOAM
CFD(計算流体力学)とOpenFOAMの設定作業を、自然言語の指示だけで進める自律エージェントAutoFOAMが提案されています。 / ベースモデルとしてQwen-coder 2.5-14Bを用い、252件のテキストプロンプトで7種類のOpenFOAM課題に合わせて調整したとされています。 / エージェントがシミュレーションを作成するだけでなく、評価し、実行し、反復的に改善する点が特徴として示されています。
論文紹介: 大規模言語モデルは自律的な臨床判断支援にまだ安全ではないのか——新着プレプリントの要旨から
arXiv上のcs.AI新着プレプリントで、医療現場における大規模言語モデルの自律的なトリアージや臨床判断支援の安全性を論じています。 / 要旨では、LLMが医師国家試験系の問題で成果を示したことや、診断推論で医師に迫る場面があることを前提にしつつ、特に『患者が最初に受診する場面』での自律的判断には安全性の証拠がまだ十分でないと問題提起しています。 / 対象は、医師の関与がほとんどない状態での症状評価・振り分けであり、医療AIの中でも実運用上の影響が大きい領域だと考えられます。
論文紹介: 深層学習における不確実性推定の手法・応用・課題をまとめた総説
深層学習における不確実性推定(UQ)を扱う総説論文で、推定手法、応用例、課題を整理した内容です。 / ベイズ近似とアンサンブル学習が、広く使われる代表的なUQ手法として挙げられています。 / 自動運転や物体検出、画像処理など、科学・工学分野の複数の応用が要旨から読み取れます。
論文紹介: タスクに応じてプロンプトを言い換えるTAPR、LLM性能向上をめざす新着プレプリント
arXivに、LLM向けのプロンプトをタスクに合わせて言い換える「TAPR」を提案する新着プレプリントが掲載されています。 / 要旨では、プロンプト作成に慣れていない利用者でも、より適した指示に整えることで下流タスクの性能向上をねらうと説明されています。 / 学習にはGRPOを用い、LLM-as-judgeによる評価を報酬に使うとされています。
