この論文では、言語モデルの最適な学習に関する理論を確立しています。圧縮率を最大化する目的を提案し、「Learning Law」と呼ばれる定理がすべての例がLMに同じ貢献度を持つべきであることを示しています。実験では、PerceptronおよびTransformerで検証され、近接ポリシーはスケーリング法則係数を本質的に改善しました。
Başka Bir Dile
kaynak içeriğinden
arxiv.org
Önemli Bilgiler Şuradan Elde Edildi
by Yuxian Gu,Li... : arxiv.org 03-05-2024
https://arxiv.org/pdf/2402.17759.pdfDaha Derin Sorular