AI×教育
QuranicMMLU、選択式が生成AIの弱点を隠すと指摘
クルアーンのアラビア語に関する言語知識を測る評価基準「QuranicMMLU」が公開された。12システムの選択式正答率は平均84%だが、自由記述の品質は平均60%にとどまり、選択式評価が実力を過大に見せることが示された。

全セクション横断 3 件
クルアーンのアラビア語に関する言語知識を測る評価基準「QuranicMMLU」が公開された。12システムの選択式正答率は平均84%だが、自由記述の品質は平均60%にとどまり、選択式評価が実力を過大に見せることが示された。

カナダの研究チームが、言語モデルの層ごとにパラメータ容量を傾斜配分する「Tapered Language Models」を発表。同一パラメータ数・計算量のまま精度を向上させる手法として、AI開発コスト削減に直結する可能性を示した。

MITの研究チームがトランスフォーマー型AIの内部動作をPythonプログラムで近似・置換する手法を開発した。金融・医療・法務など説明責任が求められる業界でのAI導入加速が期待される。
