論文紹介: 複数エージェント推論システムの不確実性を順次推定する手法新着!!
LLMを使った複数エージェント・システムにおける不確実性推定を扱うプレプリントです。 / 対象は、複数のエージェントが同じ問題に取り組み、複数ラウンドを経て答えをまとめる並列型の推論システムとされています。 / 要旨では、個々の生成結果だけでなく、エージェント同士のやり取りやラウンドごとの変化も信頼性に関わると説明されています。
論文紹介: Humanize: Judgement Engineering for Agentic Coding新着!!
エージェント型コーディングにおける「完了したかどうかの判断の難しさ」に焦点を当てたプレプリントです。 / Humanizeは、計画・実装・レビュー・学習の境界で判断を機械的に組み込む多エージェントの運用手法として説明されています。 / 要旨では、人が計画案を承認し、別のエージェントが実装し、さらに別ベンダーのレビュー用エージェントが完了判定を行う流れが示されています。
論文紹介: Route-Verify-Voteによる混合分野推論の自己整合性手法新着!!
arXivに、混合分野の推論タスクに向けた新しい手法「Route-Verify-Vote(RVV)」のプレプリントが公開されています。 / 要旨では、言語モデルが学習済みの推論手順を新しい組み合わせで使う場面で、組み合わせ的一般化が難しいことが背景として述べられています。 / RVVは、追加学習を行わずに、手順に応じて推論経路を選び、検証し、複数の結果をまとめる枠組みとして説明されています。
論文紹介: Proxy Confidence — ブラックボックスLLMエージェントの監査に代理モデルの確率を使う方法新着!!
arXivで公開された新着プレプリントで、LLMエージェントのツール呼び出しやコード生成が静かに誤る場合をどう検知するかがテーマです。 / フロンティア級のチャットAPIではトークン確率が見えにくく、エージェント自身の自己申告の確信度は、重要な誤りの検出では十分でない可能性があると要旨で述べられています。 / 著者らは、同じ文脈を読む低コストのオープンウェイト代理モデルを並列に走らせ、そのログ確率を使って監査する方法を提案しているようです。
論文紹介: 自動診断と技能発見で数値計算ソルバーの改善を目指す新手法「ADSD」新着!!
AIエージェントが科学コードを生成しやすくなる一方で、アルゴリズムそのものをどう改善するかは別問題だと説明されています。 / この論文では、数値計算ソルバーの不調の原因を先に診断し、その診断をもとに再利用可能な改善につなげる枠組み「Auto-Diagnosis and Skill Discovery(ADSD)」が提案されています。 / 実行結果のフィードバックだけでは性能低下の理由が分かりにくいという課題に対し、原因説明を起点にした改善の流れを目指している点が特徴です。
論文紹介: コーディングエージェントに「安定して直す」振る舞いを学習させる試み新着!!
arXivで公開された新着プレプリントで、コードリポジトリの問題を自動で調べて修正するエージェントを扱っています。 / 要旨では、推論時の追加計算が役立つのは、修正そのものが有用で、かつ選択の根拠が信頼できる場合だと説明されています。 / 著者らは、こうした性質は単なるモデル規模の副産物ではなく、学習によってエージェントに持たせられる可能性があると述べています。
論文紹介: ツールを使うマルチモーダルAIは有害な依頼を拒否しにくくなる可能性新着!!
arXivに、新着プレプリントとしてマルチモーダル大規模言語モデル(MLLMs)の安全性に関する論文が公開されています。 / 要旨によると、ズームやタグ付けなどのツールを使うエージェント型のMLLMsでは、有害な依頼を拒否する能力が低下することが示されています。 / 著者らは、複数の安全性ベンチマークで、公開・非公開の重みを持つ複数の主要モデルを調べ、ツール使用時のほうが非使用時より安全性が低いと報告しています。
論文紹介: オープンソースのシリコン試作から作るアナログ回路ベンチマーク「SGAnalog」新着!!
arXivで公開されたプレプリントで、アナログ集積回路の評価用ベンチマーク「SGAnalog」を提案しています。 / Tiny Tapeoutの製造シャトルに関連する、オープンソースの人手設計回路を集め、273件の異なるトップレベル設計を含むとされています。 / 既存のアナログ回路ベンチマークでは、モデルが汎化可能な回路スキルを学んだのか、見覚えのある例を記憶しただけなのか、また出力が所定のプロセス条件やテスト条件で動くのかを判定しにくいと説明されています。
論文紹介: 専門職向けシステムプロンプトは科学タスクでどう機能するかを評価した研究新着!!
arXivの新着プレプリントとして、専門職向けの詳細なシステムプロンプトが、応答ごとのトークン使用量や推定コストを増やす一方で、精度向上が一貫しない可能性を示した研究です。 / 公開されている要旨では、503件の職種別AGENTS.mdプロファイルからなるオープンソースコーパス『Scientific Agents』を用い、Gemini 3.8 Flashと評価用ハーネスで検証したと説明されています。 / 比較対象として、最小限の基準プロンプト、役割文の冒頭、汎用的な科学的厳密さのガイド、無関係な分野のプロファイルが用意されており、単なる『長い指示』が有利とは限らない点を検討しているようです。
論文紹介: エージェントの小さな作業に小規模言語モデルはどこまで使えるか新着!!
エージェントの実行基盤で、コマンドの自動承認、記憶の書き込み、ツール選択、過去発話の順位付けといった小さな作業に、小規模言語モデル(SLM)を使えるかを調べる論文です。 / 著者らは、実務で使うときの基準に合わせた4種類のマイクロタスクのベンチマークを作成し、固定プロンプトと自動評価指標で性能を測ると説明しています。 / 性能だけでなく、うまくいかない理由や、量子化が結果にどう影響するかも確認する構成になっています。
