AI関連ニュース
論文紹介: イベントに基づく個人メモリ評価ベンチマーク「FinPerMA」

LLMエージェントが、長い期間にわたってユーザーごとの好みや状況を保ちながら更新できるかを評価するベンチマークが提案されています。 / 既存の個人メモリ評価は、事実の記憶確認に偏るか、モデル生成の軌跡に強く依存していたと説明されています。 / FinPerMAは、イベントに基づく形で個人メモリを評価する点が特徴とされています。

続きを読む
AI関連ニュース
論文紹介: 消費者向けGPUで動かすローカルLLMの消費電力を比べた予備的ベンチマーク

ローカル環境でのLLM実行は、プライバシーやオンプレミス利用の観点から注目されています。 / このプレプリントは、消費者向けGPU上で9つのオープンソースLLMの消費電力を、同じ条件で比較した予備的な定量評価を示しています。 / 評価では、RTX 4060Ti 16GB、Ollama、nvidia-smiによる2Hzサンプリング、固定プロンプト सेटが使われたと説明されています。

続きを読む
AI関連ニュース
論文紹介: SME向けの誤情報対策にRAGをどう使うかを扱う新着プレプリント

小規模・中規模企業でのLLM活用において、誤情報につながる幻覚の問題をどう抑えるかがテーマです。 / 外部知識を取り込むRAGを使い、文脈に合った知識で回答精度や信頼性を高める方向性が示されています。 / 要旨の範囲では、SMEの意思決定支援や質問応答での利用を想定した分析だと読み取れます。

続きを読む
AI関連ニュース
論文紹介: AIの安全性をめぐる古典的思考実験を再検討した研究ノート

arXivの新着プレプリントとして、レイプニッツの「機械」、チューリングの模倣ゲーム、サールの中国語の部屋を、Conservation-Congruent Encoding(CCE)という枠組みで見直した研究ノートです。 / 要旨によると、タスク性能を表す指標と、内部構造がその性能をどれだけ保っているかを表す指標を区別する、簡略化された記号的な設定を定式化しています。 / 単純な検索型の仕組みとコンパクトな生成型の仕組みが、行動面では似た成果を示しうる一方で、内部の構造と働き方には違いがある、という問題意識がうかがえます。

続きを読む
AI関連ニュース
論文紹介: 自然言語だけでOpenFOAMのシミュレーションを作成・評価・反復する自律エージェント AutoFOAM

CFD(計算流体力学)とOpenFOAMの設定作業を、自然言語の指示だけで進める自律エージェントAutoFOAMが提案されています。 / ベースモデルとしてQwen-coder 2.5-14Bを用い、252件のテキストプロンプトで7種類のOpenFOAM課題に合わせて調整したとされています。 / エージェントがシミュレーションを作成するだけでなく、評価し、実行し、反復的に改善する点が特徴として示されています。

続きを読む
AI関連ニュース
論文紹介: 大規模言語モデルは自律的な臨床判断支援にまだ安全ではないのか——新着プレプリントの要旨から

arXiv上のcs.AI新着プレプリントで、医療現場における大規模言語モデルの自律的なトリアージや臨床判断支援の安全性を論じています。 / 要旨では、LLMが医師国家試験系の問題で成果を示したことや、診断推論で医師に迫る場面があることを前提にしつつ、特に『患者が最初に受診する場面』での自律的判断には安全性の証拠がまだ十分でないと問題提起しています。 / 対象は、医師の関与がほとんどない状態での症状評価・振り分けであり、医療AIの中でも実運用上の影響が大きい領域だと考えられます。

続きを読む
AI関連ニュース
論文紹介: 深層学習における不確実性推定の手法・応用・課題をまとめた総説

深層学習における不確実性推定(UQ)を扱う総説論文で、推定手法、応用例、課題を整理した内容です。 / ベイズ近似とアンサンブル学習が、広く使われる代表的なUQ手法として挙げられています。 / 自動運転や物体検出、画像処理など、科学・工学分野の複数の応用が要旨から読み取れます。

続きを読む
AI関連ニュース
論文紹介: タスクに応じてプロンプトを言い換えるTAPR、LLM性能向上をめざす新着プレプリント

arXivに、LLM向けのプロンプトをタスクに合わせて言い換える「TAPR」を提案する新着プレプリントが掲載されています。 / 要旨では、プロンプト作成に慣れていない利用者でも、より適した指示に整えることで下流タスクの性能向上をねらうと説明されています。 / 学習にはGRPOを用い、LLM-as-judgeによる評価を報酬に使うとされています。

続きを読む
AI関連ニュース
論文紹介: LLMによる数学的予想の発見と検証のための三段階パイプライン

arXivに、新しいプレプリントとして公開されたcs.AI分野の論文です。 / 大きな数学的予想を見つけるために、局所的な証拠の探索、再帰的な検証、Lean 4とMathlibでの形式的検証を組み合わせる三段階の方法が提案されています。 / 抽象では、従来は専門家の直感に強く依存していた数学的予想の生成と検証を、体系的に進めることを目指していると説明されています。

続きを読む
AI関連ニュース
論文紹介: ガイドラインに基づく臨床推論を支援する外部推論層「GuideSkill」

臨床診療ガイドラインの診断基準を、LLMが参照するだけでなく実行可能な関数として扱う「GuideSkill」が提案されています。 / GuideSkill-Zeroはガイドラインから初期化し、GuideSkill-Evoは症例と診断の組み合わせを使って不足する技能を補う設計です。 / 推論時には、LLMが鑑別診断を提案し、その候補をガイドライン由来の技能で支援する流れが示されています。

続きを読む