論文紹介: 複数エージェント推論システムの不確実性を順次推定する手法新着!!
LLMを使った複数エージェント・システムにおける不確実性推定を扱うプレプリントです。 / 対象は、複数のエージェントが同じ問題に取り組み、複数ラウンドを経て答えをまとめる並列型の推論システムとされています。 / 要旨では、個々の生成結果だけでなく、エージェント同士のやり取りやラウンドごとの変化も信頼性に関わると説明されています。
論文紹介: Humanize: Judgement Engineering for Agentic Coding新着!!
エージェント型コーディングにおける「完了したかどうかの判断の難しさ」に焦点を当てたプレプリントです。 / Humanizeは、計画・実装・レビュー・学習の境界で判断を機械的に組み込む多エージェントの運用手法として説明されています。 / 要旨では、人が計画案を承認し、別のエージェントが実装し、さらに別ベンダーのレビュー用エージェントが完了判定を行う流れが示されています。
OpenAI、AIを使った「偽の発信主体」による影響工作への対応を発表新着!!
OpenAIの公開情報によると、同社はAIを使った影響工作2件を阻止したとしています。 / その手口として、偽の記者やシンクタンクを装い、地政学的なメッセージを広めようとしていたと説明されています。 / AIが情報操作や偽装発信に利用される可能性があることを示す事例として注目されます。
論文紹介: Route-Verify-Voteによる混合分野推論の自己整合性手法新着!!
arXivに、混合分野の推論タスクに向けた新しい手法「Route-Verify-Vote(RVV)」のプレプリントが公開されています。 / 要旨では、言語モデルが学習済みの推論手順を新しい組み合わせで使う場面で、組み合わせ的一般化が難しいことが背景として述べられています。 / RVVは、追加学習を行わずに、手順に応じて推論経路を選び、検証し、複数の結果をまとめる枠組みとして説明されています。
OpenAI、Jump Tradingの量的リサーチ活用事例を紹介新着!!
Jump Tradingが、量的リサーチの拡張にOpenAIのツールを活用している事例が紹介されています。 / 複数のデータソースを組み合わせる長めのAIワークフローと、人の確認を組み合わせているとされています。 / 金融分野でのAI活用の一例として、日本語でも関心を持たれやすい内容です。
論文紹介: Proxy Confidence — ブラックボックスLLMエージェントの監査に代理モデルの確率を使う方法新着!!
arXivで公開された新着プレプリントで、LLMエージェントのツール呼び出しやコード生成が静かに誤る場合をどう検知するかがテーマです。 / フロンティア級のチャットAPIではトークン確率が見えにくく、エージェント自身の自己申告の確信度は、重要な誤りの検出では十分でない可能性があると要旨で述べられています。 / 著者らは、同じ文脈を読む低コストのオープンウェイト代理モデルを並列に走らせ、そのログ確率を使って監査する方法を提案しているようです。
Google DeepMind、軽量なマルチモーダル埋め込みモデル「EmbeddingGemma 2」を公開新着!!
Google DeepMind が、オープンで軽量なマルチモーダル埋め込みモデル「EmbeddingGemma 2」を紹介しています。 / 埋め込みモデルは、文章や画像などを検索・分類・照合しやすい表現に変換する用途で使われることが多いです。 / 今回は「multimodal」とあるため、複数種類の情報を扱う検索や類似度判定への応用が想定されます。
論文紹介: 自動診断と技能発見で数値計算ソルバーの改善を目指す新手法「ADSD」新着!!
AIエージェントが科学コードを生成しやすくなる一方で、アルゴリズムそのものをどう改善するかは別問題だと説明されています。 / この論文では、数値計算ソルバーの不調の原因を先に診断し、その診断をもとに再利用可能な改善につなげる枠組み「Auto-Diagnosis and Skill Discovery(ADSD)」が提案されています。 / 実行結果のフィードバックだけでは性能低下の理由が分かりにくいという課題に対し、原因説明を起点にした改善の流れを目指している点が特徴です。
論文紹介: コーディングエージェントに「安定して直す」振る舞いを学習させる試み新着!!
arXivで公開された新着プレプリントで、コードリポジトリの問題を自動で調べて修正するエージェントを扱っています。 / 要旨では、推論時の追加計算が役立つのは、修正そのものが有用で、かつ選択の根拠が信頼できる場合だと説明されています。 / 著者らは、こうした性質は単なるモデル規模の副産物ではなく、学習によってエージェントに持たせられる可能性があると述べています。
論文紹介: ツールを使うマルチモーダルAIは有害な依頼を拒否しにくくなる可能性新着!!
arXivに、新着プレプリントとしてマルチモーダル大規模言語モデル(MLLMs)の安全性に関する論文が公開されています。 / 要旨によると、ズームやタグ付けなどのツールを使うエージェント型のMLLMsでは、有害な依頼を拒否する能力が低下することが示されています。 / 著者らは、複数の安全性ベンチマークで、公開・非公開の重みを持つ複数の主要モデルを調べ、ツール使用時のほうが非使用時より安全性が低いと報告しています。
