Re: [問卦] 中研院自己做的大型語言模型怎麼了？ sxy67230 PTT批踢踢實業坊

Re: [問卦] 中研院自己做的大型語言模型怎麼了？

作者: sxy67230 (charlesgg) 2023-10-09 14:34:24

※ 引述《messi5566 (虹粉)》之銘言：
: 中研院最近發布了他們自己開發的LLM
: 說是在處理繁體中文的任務上表現優異
: 可是小妹看了一下跑出來的成果
: https://i.imgur.com/I1zNnIa.png
: https://i.imgur.com/BJIxJY6.png
: 請問繁體中文的任務內容是把簡體翻譯過來嗎
: 詳細資料在這裡
: https://huggingface.co/spaces/ckiplab/CKIP-Llama-2-7b-chat
阿肥外商碼農阿肥啦！
昨天晚上都在跟獵人直播來不及趕上大型翻車現場，這邊中午看hugging face hub還
可以進去，但現在已經進不去了。
這邊阿肥就直接說，基本上現在所有中文開源語言模型除了少數像chatGLM這種中國比較
早期做的自己完全從零訓練的語言模型外，大家都是從meta 的llama魔改的，差別在於預
訓練或微調的數據源跟一些微調小細節而已。
然後大家想知道這個模型是不是本土完全從零開始可以從hugging face上的模型config跟
作者說的訓練數據源來看細節藏在魔鬼裡。
首先，依據新聞阿肥看了一下數據是用dolly-15k跟COIG-PC然後用opencc 轉繁體訓練，
理論上原生的meta llama 2的vocabulary size是32000，然後當前對岸開源的簡中llama
2 vocabulary size 是 55296，CKIP開源的那個看起來是65000。
理論上如果是完全從英文的llama 2 預訓練依照這兩個數據集詞彙詞典大小不會那麼大的
，所以這邊推測有可能這個模型原始就不是從原生llama 2開始的。
此外，這兩個數據集都是簡中數據集，中研院不知道哪個阿天以為只要opencc 簡轉繁就
可以訓練，完全無視繁中的用詞跟簡中用詞的差異。更天的是拿C-Eval這個簡中評測集做
評測，根本是拿明朝的劍斬清朝的官。
當前政府一堆研究單位早就落後中國不止一輪了，人家中國四五年前就砸哈工大幾億人民
幣再做簡中數據集了。
那個時候阿肥就一直再說台灣想做自己的AI一定要先從數據中心、數據工程開始，建立屬
於台灣自己的數據集，結果過了幾年中研院依然是畫大餅的單位，年初阿肥參加過幾個會
議聽到中研院再那邊高喊要要做自己的LLM，阿肥還以為中研院自己秘密建立了一套數據
中心，想必一定砸大錢，結果竟然是拿對岸的數據訓練，也不知道哪個天才研究員覺得只
要簡轉繁AI就會自己講台灣用語。
唉～
這邊註一下：
Vocabulary size是指當前LLM再預訓練會先把文字依據數據集切分成對應大小AI自己學會
的Token，詞會儲存起來對應成ID，AI模型其實真正預測的是這個詞表的ID最後再轉換回
人類有辦法閱讀的中文或英文字。
C-Eval是中國清華北大釋出來的評測集，簡單理解就是AI輸出的文字跟人類的回答有多接
近，他會做一些規範劃分成20-30個領域看看AI究竟有沒有學會到文字裡面的文化或是專
業領域知識。
以上
阿肥自己目前也在幫公司做繁中的語言模型，目前阿肥因為繁中數據有限所以
阿肥都是盡可能把模型縮限在小範圍超過分佈就拒絕回答，敢這樣做到那麼通用還不是拿
自己的
大量數據集來訓練，我感覺CKIP可能要有大地震了。
呵呵….

繼續閱讀

[問卦] 年輕人是不是真的很可悲yuan55226 Re: [問卦] 有沒有香港的漢堡比較好吃的八卦yokann Re: [新聞] 自曝多次致電柯文哲　侯友宜：可惜撥通flybow Re: [新聞] 憤怒！哈瑪斯武裝份子擄走多名以色列幼tosay [新聞] 港湖藍大於綠、靠少部分綠選不上？吳欣岱tiger911 [問卦] 為什麼女生動不動翻白眼fatslave [問卦] 教育部影片事件叫社群編輯雅婷道歉負責giorno78 [問卦] 幹愛當台女舔狗的統統給我進來sulanpa [問卦] 去百貨一直被偷看pttbeigowow [問卦] 「反正我很閒」會怎麼拍0-6歲國家養？WeGoStyle