多段検索の誤答を予測し保留する手法を提案
多段検索型の質問応答で、確信を持った誤答の危険を追加のLLM呼び出しなしで推定し、回答を保留する手法RegimeAbstainが提案された。回答範囲を5割に絞る条件で、MuSiQueの確信的誤答率は39.5%から20.6%に低下した。

10本掲載
多段検索型の質問応答で、確信を持った誤答の危険を追加のLLM呼び出しなしで推定し、回答を保留する手法RegimeAbstainが提案された。回答範囲を5割に絞る条件で、MuSiQueの確信的誤答率は39.5%から20.6%に低下した。

YOLOv2に標識の形状照合を加えるとmAPが0.680から0.713に上昇した。自動運転・ADAS開発で、似た標識の誤認識対策に示唆を与える研究である。

国際脳研究所を含む研究チームが、マウス139匹・276脳領域の記録を用いた評価基準「BrainWideBench」を公表した。事前学習の効果は確認されたが全課題で優れる手法はなく、研究投資の判断材料となる。

AIエージェント利用者の投稿7万3093件を分析した研究で、成果物の場面では価値が満たされる一方、監督の場面では6つの価値群すべてで満たされにくいと判明した。企業は成果の精度に加え、費用・権限・監督の設計を問われる。

研究チームは、既存のソースコードだけから強化学習用の訓練課題を自動生成する手法CodeMidasを開発した。5,545件の課題で学習したAIエージェントは、全5ベンチマークで性能が向上した。

研究チームは、複数の参照素材から動画を生成する「オムニR2V」の評価基盤OmniVBenchと、業務用映像を主体とする学習データ34万件を公開した。既存モデルの弱点が可視化され、広告・映像制作での導入判断に資する。

医療向けAIモデルを扱った論文114本を分析した研究が、財務・計算・組織・社会の4種のコストの評価が不十分な実態を整理した。AI導入を判断する医療機関や関連企業に、評価指標の見直しを促す内容である。

仏研究チームは、建設業の労災報告のみで学習したAIが、金属業や化学・プラスチック業、企業独自の報告にも再学習なしで適用でき、平均バランス精度85%台を得たと報告した。業種横断の労災分析の効率化につながる成果である。

研究チームは、スマートフォン、PC、ウェブの画面操作や部品の特定、ツール利用を単一で担う視覚言語モデル群「MintAct」を発表した。専門モデルに匹敵する性能を示し、業務自動化の基盤として注目される。

重みの更新や人手のラベルを使わず、実利用の依頼履歴から設計手順を蓄積するデザインAIの枠組みが登場した。ベンチマークの実行成功率は72.7%から99.3%に向上し、制作現場への応用が視野に入る。
