AI関連ニュース
論文紹介: 「Agreement Is Not Alignment」— 人間とLLMの倫理判断が一致しても、判断の根拠は同じとは限らない

人間とLLMの最終的な判断が一致していても、その根拠まで同じとは限らない、という点を扱うプレプリントです。 / ETHICS由来の500件のベンチマークを使い、5つの道徳判断分野で人間注釈とLLM注釈を比較したとされています。 / 単なる正解一致だけでは、倫理的な整合性を十分に測れない可能性がある、という問題提起が読み取れます。

続きを読む
AI関連ニュース
論文紹介: LLMの研究協力者としての研究倫理を評価するベンチマーク「IntegrityBench」

arXivで公開された新着プレプリントで、LLMが「共同研究者」として振る舞う場面における研究倫理を評価する枠組みが提案されています。 / 提案されたIntegrityBenchは、誤った行為の分類、倫理的な判断の理由づけ、資料に基づく意思決定などを、36の課題と複数段階の圧力条件で調べる設計です。 / 要旨によれば、18種類の先端モデルを評価した結果、強い圧力条件では重要な倫理判断の一部で失敗が見られたとされています。

続きを読む
AI関連ニュース
論文紹介: LLMs in Process Diagram Engineering: PFDとP&ID作成を支援するAIパイプライン

arXivで公開された新着プレプリントで、PFD(Process Flow Diagram)からP&ID(Piping and Instrumentation Diagram)への作成・変換をAIで支援する手法が紹介されています。 / 要旨では、図面作成の手作業を減らし、作業時間の短縮や候補案の探索を通じた効率化の可能性が示されています。 / 研究は「P&ID Pilot」という、流れ図の作成を2段階で扱うエンドツーエンドのAIパイプラインとして説明されています。

続きを読む
AI関連ニュース
論文紹介: プロンプト最適化を文のまとまりごとに行う手法「SAPO」

Automatic Prompt Optimization(APO)では、プロンプト全体を一括で書き換える方法が多い一方、ある振る舞いは改善しても別の振る舞いが悪化することがあると説明されています。 / この論文では、プロンプトを役割・文脈・課題・出力形式の区間に分け、区間ごとに改善を行うSAPOという手法が提案されています。 / 改善の判断には、上位5件と下位5件の例を使い、1つのLLMと静的なメタプロンプト、構造化出力を組み合わせる流れが示されています。

続きを読む
AI関連ニュース
論文紹介: AutoWorldModel-Bench — 世界モデル研究の自律改善を測るベンチマーク

arXivで公開された新着プレプリントで、AIエージェントが世界モデル研究を自律的に進めるためのベンチマークが提案されています。 / 要旨では、世界モデル研究は手法や学習目的、状態表現の組み合わせが難しく、環境ごとの最適解が一様ではないと説明されています。 / このベンチマークは、前線のコーディングエージェントが閉ループで世界モデルを改善する設定を扱う点が特徴とされています。

続きを読む
AI関連ニュース
論文紹介: スキルベースのエージェントAIで通信相手と通信コストを動的に考える新しい枠組み

arXivの新着プレプリントとして、複数のLLMエージェントを使うAIシステムにおける「誰と通信するか」「どれだけ通信するか」を扱う研究が公開されています。 / 固定的な全体通信では、トークンコストや遅延、重複、誤りの伝播が増えやすいと説明されています。 / 著者は、エージェント選択と通信を協力ゲームとして捉え、タスクごとの便益とコストを分けて考える枠組みを提案しています。

続きを読む
AI関連ニュース
論文紹介: NL2SHACL-Bench: 自然言語からSHACLへの変換を評価するベンチマーク群

SHACLはRDF知識グラフの整合性検証に使われる技術ですが、形状定義の作成には専門知識が必要だと説明されています。 / この論文は、自然言語の要件をSHACLに変換する課題に向けて、専用の評価用ベンチマーク群を提案しています。 / 要旨では、生成されたSHACL形状の評価には単純な文字列比較では足りず、意味的に等価でも表現が異なる場合があるとされています。

続きを読む
AI関連ニュース
論文紹介: 予測のためのプローブは誤りを見つけても、最終的な失敗予測には結びつかない可能性

arXivの新着プレプリントで、言語モデル内部の状態を読む線形プローブが、誤った文脈の検出には高い精度を示す一方、最終的な答えの正しさの予測にはつながりにくいと報告されています。 / 多段の計算や推論の連鎖では、誤った文脈を見分ける情報と、最終出力が正しいかどうかは一致しない場合があるとされています。 / 信頼度を構造化した形式で出させる条件では、値が二つに集中し、誤り率の違いが見えにくかったと要旨で示されています。

続きを読む
AI関連ニュース
論文紹介: MLLMの視覚トークン削減に向けた中間層アテンション予測の研究

マルチモーダル大規模言語モデル(MLLM)の推論コストを抑えるため、視覚トークンの削減に関する研究です。 / 中間層のテキストから視覚へのアテンションを使って、どの視覚トークンを残すかを見積もる流れが紹介されています。 / 要旨によると、従来の「事前に決めた中間層のアテンションを使う」方法には課題があり、その改善を目指しているようです。

続きを読む
AI関連ニュース
論文紹介: EntropyMoE: トークナイザー不要LLM向けのエントロピー対応スパース・エキスパートルーティング

arXivの新着プレプリントで、カテゴリはcs.AIです。 / 要旨では、byte-levelのトークナイザー不要LLMにおいて、動的なbyte patchごとに同じ密な計算を行う従来構成の限界を指摘しています。 / 提案手法EntropyMoEは、Mixture-of-Expertsを用いて、patchの性質や粒度に応じて計算資源の配分を変える構成だと説明されています。

続きを読む