最近、テクノロジー系メディアの9to5Macは、Appleの研究チームが「リストベースの強化学習」(RLCF)という新たな手法を提案し、従来の人間による評価に代えてタスクリストを用いることで、大規模言語モデルの複雑な指示の実行能力を大幅に向上させたと報じました人間の「いいね」や「ダメ」に依存するRLHFとは異なり、RLCFでは各指示に対して具体的なチェック項目を生成し、項目ごとに点数を付与します例えば「スペイン語に翻訳されているか?」といった具合です最終的には0~100点の総合評価に基づいてモデルの最適化を指導します
研究チームは、Qwen25-7B-Instructモデルを対象にこの手法を検証し、主要な5つの評価ベンチマークを網羅しましたその結果、RLCFはすべてのテストで改善をもたらした唯一の手法であり、FollowBenchにおける厳格な満足度は4ポイント上昇、InFoBenchでは6ポイント、Arena-Hardでは勝率が3ポイント増加し、一部のタスクでは最大82%の向上を示しましたこの成果は、リストによるフィードバックが特に多段階の複雑な指示処理において有効であることを示していますなお、リストの生成プロセスには大きな工夫が見られ、研究チームはより大規模なQwen25-72B-Instructモデルを活用して13万件の指示に対応する「WildChecklists」データセットを構築し、大規模モデルを“教師”として小規模モデルの回答を項目ごとに採点させました
顕著な効果にもかかわらず、研究者らはRLCFにいくつかの限界も指摘していますこの手法は評価者として強力なモデルに依存しているため、リソースが制限される環境では普及が難しい可能性がありますまた、当初の設計目的は指示の実行精度の向上であって、安全性の整合性を確保することではないため、安全性評価の代替としては不十分ですアナリストらは、本研究がAIの訓練手法に新たな道を開いたものの、さまざまなタスクへの広範な適用には、さらなる汎用性の検証が必要だと見ています