論文紹介: LLMの安全性評価で、プロンプト言語が判断に影響する可能性を示す新着プレプリント
arXivの新着プレプリントで、LLMの安全性や応答のばらつきがプロンプトの言語によって変わる可能性を検討しています。 / 著者は9つのモデルを6つの提供元から集め、高リスクな架空シナリオで英語と日本語のプロンプトを比較しています。 / 要旨では、日本語のプロンプトで発射判断が下がる傾向が見られたと述べられていますが、詳細な条件や統計的な解釈は本文確認が必要です。
論文紹介: 「Agreement Is Not Alignment」— 人間とLLMの倫理判断が一致しても、判断の根拠は同じとは限らない
人間とLLMの最終的な判断が一致していても、その根拠まで同じとは限らない、という点を扱うプレプリントです。 / ETHICS由来の500件のベンチマークを使い、5つの道徳判断分野で人間注釈とLLM注釈を比較したとされています。 / 単なる正解一致だけでは、倫理的な整合性を十分に測れない可能性がある、という問題提起が読み取れます。
OpenAI、GPT-5.6 Sol向けの高速モード「Ultrafast mode」を予告
OpenAIが、API向けの新しいサービス階層として「Ultrafast mode」の予告を公開しています。 / GPT-5.6 Solを最大14倍高速で動かし、最大で毎秒750トークンの出力に対応するとされています。 / 高速化の基盤にはCerebrasが使われていると説明されています。
論文紹介: LLMの研究協力者としての研究倫理を評価するベンチマーク「IntegrityBench」
arXivで公開された新着プレプリントで、LLMが「共同研究者」として振る舞う場面における研究倫理を評価する枠組みが提案されています。 / 提案されたIntegrityBenchは、誤った行為の分類、倫理的な判断の理由づけ、資料に基づく意思決定などを、36の課題と複数段階の圧力条件で調べる設計です。 / 要旨によれば、18種類の先端モデルを評価した結果、強い圧力条件では重要な倫理判断の一部で失敗が見られたとされています。
OpenAIのDaybreakモデル、AWSのAmazon Bedrockで利用可能に
OpenAIとAWSが、Daybreakのサイバーセキュリティ機能をAmazon Bedrock経由で提供すると発表しています。 / 企業向けのセキュリティ業務を支える用途が想定されており、既存のAWS環境で利用しやすくなる可能性があります。 / 現時点では、具体的な機能範囲や利用条件は公開情報の範囲で確認が必要です。
論文紹介: LLMs in Process Diagram Engineering: PFDとP&ID作成を支援するAIパイプライン
arXivで公開された新着プレプリントで、PFD(Process Flow Diagram)からP&ID(Piping and Instrumentation Diagram)への作成・変換をAIで支援する手法が紹介されています。 / 要旨では、図面作成の手作業を減らし、作業時間の短縮や候補案の探索を通じた効率化の可能性が示されています。 / 研究は「P&ID Pilot」という、流れ図の作成を2段階で扱うエンドツーエンドのAIパイプラインとして説明されています。
論文紹介: プロンプト最適化を文のまとまりごとに行う手法「SAPO」
Automatic Prompt Optimization(APO)では、プロンプト全体を一括で書き換える方法が多い一方、ある振る舞いは改善しても別の振る舞いが悪化することがあると説明されています。 / この論文では、プロンプトを役割・文脈・課題・出力形式の区間に分け、区間ごとに改善を行うSAPOという手法が提案されています。 / 改善の判断には、上位5件と下位5件の例を使い、1つのLLMと静的なメタプロンプト、構造化出力を組み合わせる流れが示されています。
論文紹介: AutoWorldModel-Bench — 世界モデル研究の自律改善を測るベンチマーク
arXivで公開された新着プレプリントで、AIエージェントが世界モデル研究を自律的に進めるためのベンチマークが提案されています。 / 要旨では、世界モデル研究は手法や学習目的、状態表現の組み合わせが難しく、環境ごとの最適解が一様ではないと説明されています。 / このベンチマークは、前線のコーディングエージェントが閉ループで世界モデルを改善する設定を扱う点が特徴とされています。
RingCentralがChatGPT WorkとCodexでAIネイティブな業務づくりを進めると紹介
RingCentralが、ChatGPT WorkとCodexを使ってAI製品開発を加速していると紹介されています。 / エンジニアリングと運用の情報を集約し、業務の見通しを高める取り組みが示されています。 / OpenAIの公式紹介記事なので、一次情報として参照しやすい内容です。
OpenAI、Dali Rajic氏を最高収益責任者に任命
OpenAIがDali Rajic氏をChief Revenue Officer(最高収益責任者)に任命したと発表しています。 / 同氏は、OpenAIのグローバルな収益組織を率い、企業がAIの価値を引き出す支援を担うとされています。 / AI技術そのものの新発表ではありませんが、事業体制や企業向け展開に関する公開情報としてはニュース価値があります。
