論文紹介: Vision-Language-Actionモデルの「前提の食い違い」への応答を測るベンチマークConflictVLA-Bench
Vision-Language-Action(VLA)モデルが、無効な前提を含む課題にどう反応するかを調べるベンチマークが提案されています。 / 著者らは、単なる失敗だけではなく、課題を続けようとして結果的に誤る「Failed Persistence」という振る舞いに注目しています。 / ConflictVLA-Benchは、前提が食い違う試行と、前提に一致した参照試行を組み合わせて評価する設計だと説明されています。
論文紹介: プライバシーに配慮した臨床意思決定支援のためのエージェント型AI「SMARtCARE」
長文の臨床AIでは、過去の入院歴や病状変化が文脈から外れて見落とされる課題があるとされています。 / SMARtCAREは、ICU監視を念頭に、状態を4段階で切り替える臨床支援アーキテクチャとして提案されています。 / 患者の過去の経過をそのまま再取得するのではなく、6チャネルの「fingerprint」で扱う点が特徴として説明されています。
論文紹介: BioEVAL — バイオエンジニアリング向けの大規模言語モデル・マルチモーダルモデル評価ベンチマーク
BioEVALは、バイオエンジニアリング分野における大規模言語モデルとマルチモーダルモデルの実験的な推論能力を評価するための新しいベンチマークとして紹介されています。 / 既存の評価は事実の想起に偏りがちで、最先端の課題やマルチモーダルな課題での性能を十分に見にくい、という問題意識が示されています。 / 11の主要なバイオエンジニアリング分野を含む、グローバルかつ複数機関による取り組みとして説明されています。
論文紹介: マルチエージェントのコード判定は「根拠がある時だけ答える」べきかを検討する新着プレプリント
arXivで公開された新着プレプリントで、コードの正しさを別のモデルが判定する場面を扱っています。 / 要旨では、モデルが根拠の有無を区別せず、確信のある判定のように返してしまう問題意識が示されています。 / 著者らは、検証対象から独立した証拠であることと、答えと十分に異なる証拠であることが重要だと述べています。
論文紹介: 時系列基盤モデルの多段予測における不確実性量子化手法「SGA」
時系列基盤モデル(TSFM)の多段予測で生じる不確実性を扱う手法として、SGAが提案されています。 / 原文の要旨では、予測が時間とともに枝分かれし、将来ステップへ不確実性が広がる点が課題として説明されています。 / 本件は arXiv 上の新着プレプリントで、全文PDFではなく要旨ベースの紹介です。
論文紹介: 強化学習ポリシーの監査可能性を6つの観点で分けて調べた新着プレプリント
強化学習のポリシーを、監査しやすい離散的な行動ルールとして表せるかを扱う新着プレプリントです。 / 監査可能性を、トレースの整合性、圧縮の損失の少なさ、ルールの網羅性、行動の一致、組み合わせたときの品質、価値モデルの信頼性という6項目に分けて定義しています。 / 共有の固定シンボライザや受動的なルール抽出など、複数の仕組みを使うプロトコルが示されています。
論文紹介: 対話型ロールプレイ強化学習のための敵対的な閉ループ型カリキュラム「AdvRole」
大規模言語モデルを使ったロールプレイ型エージェントの学習に関する新しいプレプリントです。 / 著者らは、学習前に集めた固定シナリオだけでは、エージェントの改善に合わせて難しい場面が変化していく問題に対応しにくいと述べています。 / そこで、弱点に応じて文脈を書き換えながら学習を回す「閉ループ型カリキュラム」としてAdvRoleを提案しています。
論文紹介: 合成ペルソナは実際の読者反応を予測できるのか――コピー評価のsim-to-real研究
LLMを使った「合成ペルソナ」で、広告文や見出しの反応を事前に予測できるかを検証する新しいプレプリントです。 / Upworthy Research Archive の多数の見出しA/Bテストを、実際のクリック率を含む比較対象として使っています。 / 10人のペルソナからなる評価と、ペルソナを使わない基準手法を比べていると要旨で説明されています。
論文紹介: CaLR: Causal Latent Revision for Robust Diffusion Reasoning
arXivで、拡散型言語モデルの推論を対象にした新しい枠組み「CaLR」が公開されています。 / 要旨では、自己回帰モデルの局所的な貪欲さと、拡散型言語モデルが持つ因果構造の弱さの両方を補う狙いが示されています。 / CaLRは、専門モデルから得た因果トポロジー行列と暗黙的微分を使い、推論途中の“thought revision”を行うと説明されています。
論文紹介: Attention-Aware Routing: Mixture-of-Expertsのルーティングに注意機構の情報を組み合わせる提案
Mixture-of-Experts(MoE)型の言語モデルで、どの専門家を選ぶかを決めるルーターに注意重みの情報を加える手法が提案されています。 / 提案手法 Attention-Aware Routing(AAR)は、スライディングウィンドウ内の注意重みから時間的・周波数的な特徴を取り出し、ルーターに使うと説明されています。 / 本文要旨では、ベースのTransformer本体を固定し、ルーティング部分だけを学習しているため、ルーティングそのものの効果を切り分けやすい設計だと読めます。
