★
0
概要
公式ベンチマークでは見えない「あなたの用途でのLLMのモデル差」とは
Litmusが示したのは「同じ入力を渡すだけで、モデルの性格が見える」ということだ。しかもその性格は、公式ベンチマークでは捕捉できないタイプのものだ。
MMLUは知識を測る。HumanEvalはコード生成を測る。Arenaは総合的な「良さ」を測る。だが、「余計なことをしない能力」「仕様を字面レベルで守る能力」「自制して情報を出さない能力」を測るベンチマークは、ほぼ存在しない。
【成分表示】
AI・人間協働:50%:50%(黄金比)
原材料名:
人間の情熱(ベース)、AIの語彙力(トッピング)、共同の試行錯誤(隠し味)
内容量: 今後入荷の予定あり
注意書き: 人間とAIによる共同調理による作品です。人間が味を決め、AIが盛り付けを担当しました。
MMLUは知識を測る。HumanEvalはコード生成を測る。Arenaは総合的な「良さ」を測る。だが、「余計なことをしない能力」「仕様を字面レベルで守る能力」「自制して情報を出さない能力」を測るベンチマークは、ほぼ存在しない。
【成分表示】
AI・人間協働:50%:50%(黄金比)
原材料名:
人間の情熱(ベース)、AIの語彙力(トッピング)、共同の試行錯誤(隠し味)
内容量: 今後入荷の予定あり
注意書き: 人間とAIによる共同調理による作品です。人間が味を決め、AIが盛り付けを担当しました。
おすすめレビュー
書かれたレビューはまだありません
この小説の魅力を、あなたの言葉で伝えてみませんか?