OpenAIが「Astra」に関する安全性評価を公表、サイバー能力の基準に到達と説明
OpenAIは、AstraがPreparedness Frameworkの「Critical cybersecurity capability threshold」に初めて到達したモデルだと発表しています。 / あわせて、公開に向けてより強い安全対策を適用すると説明されています。 / 対象はモデルの能力評価と安全策であり、現時点では製品機能の詳細や一般公開の範囲は要旨からは分かりません。
Google DeepMind、Geminiによる「agentic video understanding」を紹介
Google DeepMindの公式ブログで、Geminiを用いた「agentic video understanding」が紹介されています。 / 動画を受動的に見るだけでなく、必要に応じて関連箇所を探し、理解を助ける使い方が示されている可能性があります。 / 現時点で確認できるのはタイトルと公開情報のみで、具体的な手法や評価結果は要確認です。
論文紹介: LLM評価を測るためにRasch測定理論を用いる提案
arXivの新着プレプリントとして、LLM評価を「測定」の問題として捉え直す研究が公開されています。 / この論文は、LLMがベンチマークで採点される側、他モデルの出力を判断する側、人間の文章を評価する側のいずれにも関わる状況を扱っています。 / 要旨では、従来の評価では評価結果を形づくる要素の役割分担が十分に見えにくく、Rasch measurement theoryがその整理に向いていると説明されています。
論文紹介: 実環境に近い条件で一般的なモバイルアシスタントを評価するベンチマーク GMA
arXivの新着プレプリントとして、一般的なモバイルアシスタントを評価するためのベンチマーク「GMA」が提案されています。 / 既存の AndroidWorld や MobileWorld などを土台にしつつ、実際のモバイル利用の多様さや複雑さをより反映することを目指していると説明されています。 / 要旨では、オープンソースのプロジェクトを基にした7つのアプリケーションを含むことが示されています。
Hugging Face Blog: GradioでAIワークフローを配線し、実行し、公開する方法
Hugging Face Blogで、Gradioを使ったAIワークフローの扱い方が紹介されています。 / タイトルからは、AIアプリの作成だけでなく、実行や公開までの流れをまとめた解説記事とみられます。 / Gradioを使う開発者にとって、基本的な使い方から運用の考え方までを確認する手がかりになりそうです。
OpenAI、ブラジルでの展開拡大を発表
OpenAIがブラジルでの存在感を広げると発表しています。 / 開発者、企業、コミュニティとの関与を深め、ブラジル全体でのAI導入を支える方針です。 / 現時点で確認できる範囲では、具体的な製品発表や契約内容は示されていません。
OpenAIが学生向けの研究結果を公開 ChatGPTと批判的思考トレーニングの学習効果を検討
1,000人超の学生を対象に、ChatGPT、批判的思考、独創性、大学の実課題での成績を調べたランダム化研究だと説明されています。 / AIツールの利用だけでなく、批判的思考の訓練を組み合わせた場合に、学生が何を得るのかを検討する内容です。 / 大学教育における生成AIの使い方や、学習支援の設計を考える材料になりそうです。
OpenAIとタイMHESI、AIスタートアップ支援の8週間アクセラレータを開始
OpenAIとタイの高等教育・科学・研究・イノベーション省(MHESI)が、AIスタートアップ向けの支援プログラムを開始したと発表されています。 / 対象は、ヘルスケア、ウェルネス、教育分野の10社で、8週間のアクセラレータとして実施されるとされています。 / AIの試作品を、信頼される製品へ育てることを目指す取り組みとして説明されています。
OpenAI、ロシア由来とみられる影響工作アカウントを停止したと発表
OpenAIは、ロシア由来とみられるアカウント群を停止したと発表しています。 / これらのアカウントは、AIを使って偽のイスラエル拠点のシンクタンクや「主権」指標を広め、ロシアを称賛し西側を批判する内容を発信していたとされています。 / 公開情報の範囲では、生成AIが情報操作に悪用される事例として関心が高い内容です。
論文紹介: 金融計算の質問応答を支える、決定的なツール連携マルチエージェントLLM枠組み「CIFQA」
arXivで、新着プレプリントとして金融向け質問応答の枠組み「CIFQA」が公開されています。 / 要旨では、LLMが多段の金融計算でもっともらしい誤答を返すことがある点を課題として挙げています。 / CIFQAは、決定的なツール連携とマルチエージェント構成を組み合わせ、数値計算やルールベース条件に対応することを目指すと説明されています。
