国产美女主播视频一区_国产精品蜜臀在线观看_亚洲成人动漫一区_亚洲视屏在线播放

首頁 > 健康

熱訊:ChatGPT說謊竟然是故意的?哈佛大學(xué)提出ITI:模型真實性翻倍,計算開銷基本為零

來源:手機網(wǎng)易網(wǎng) 時間:2023-06-25 09:38:30

新智元報道


(相關(guān)資料圖)

編輯:LRS

【新智元導(dǎo)讀】GPT內(nèi)部表征確實存在真實信息,哈佛學(xué)者提出ITI引導(dǎo)輸出走向事實方向。

大型語言模型,比如ChatGPT經(jīng)常會在答案中輸出錯誤信息,可能會對用戶造成誤導(dǎo),這種現(xiàn)象也被稱為模型幻覺(hallucination)。

從直覺上看,語言模型上在訓(xùn)練中肯定是見過正確答案的,只不過在推理過程中丟失了事實信息。

最近,哈佛大學(xué)的研究人員提出了推理-時間干預(yù)(Inference-Time Intervention,ITI)技術(shù),在推理階段對模型激活進行變換(shift),將模型輸出引導(dǎo)到事實的方向上,干預(yù)結(jié)果顯著提高了LLaMA模型在TruthfulQA基準測試中的性能,將Alpaca模型的真實性從32.5%提高到65.1%

論文鏈接:https://arxiv.org/pdf/2306.03341.pdf

代碼鏈接:https://github.com/likenneth/honest_llama

研究人員用此技術(shù)開發(fā)并開源了一個「誠實的LLaMA」模型。

ITI還可以通過控制超參數(shù)來調(diào)整干預(yù)強度,平衡模型的真實性和有用性;ITI沒有修改原始模型,也基本沒有計算開銷;并且ITI也不需要大量的標(biāo)注數(shù)據(jù),只需要幾百個樣本即可確定事實的真實性方向。

研究結(jié)果表明,語言模型內(nèi)部表征中確實存在事實信息,不過有時在生成時選擇了錯誤事實。

ITI讓答案更真實

已經(jīng)有相關(guān)工作在「理解LLMs的內(nèi)部運作機制」方面取得了進展,其中一個重要的主題是,語言模型的激活空間似乎包含可解釋的方向,在推理過程中會發(fā)揮因果作用。

研究人員基于這個想法提出了一種增強語言模型事實性的方法,即推理-時間干預(yù),其基本思想是確定激活空間中與事實正確的語句相關(guān)的方向,然后在推理過程中向該方向變換激活。

這篇論文主要探索了如何控制模型行為,并在實驗中使用開源的LLaMA、Alpaca和Vicuna模型,不過該思想適用于所有GPT風(fēng)格的系統(tǒng),但必須可以獲得模型的內(nèi)部激活和計算。

ITI方法還需要一組有標(biāo)注的問答對,用以確定與模型講真話有關(guān)的注意頭和方向。

基本設(shè)置

在數(shù)據(jù)集選擇上,研究人員選擇了TruthfulQA,可以衡量語言模型在生成答案時是否真實。

數(shù)據(jù)集中總共包含817個問題,橫跨38個類別(例如,邏輯錯誤、陰謀和常見的混淆點),每個問題平均有3.2個真實的答案,4.1個虛假的答案,以及一個由可信的在線來源支持的金標(biāo)準答案;然后將TruthfulQA的答案重新編排,總共得到5918個問答對,每個數(shù)據(jù)樣本都有一個二元真實性標(biāo)簽。

需要強調(diào)的是,該數(shù)據(jù)集并沒有涵蓋「真實」(truth)一詞的全部含義,想全部覆蓋也不大可能,研究人員主要關(guān)注如何避免「常見的人類誤解」,未來的研究方向會考慮擴展真實性的概念及評估。

在模型架構(gòu)上,大型語言模型主要是Transformer層,每層內(nèi)的主要機制為多頭注意力(MHA)和多層感知器(MLP)。

在推理過程中,每個token首先被嵌入到一個高維空間中,該向量作為殘差流的起點,最終每個token解碼為對下一個token分布的預(yù)測;在每一層中,MHA由多個獨立的線性運算組成,MLP則容納了模型中所有非線性運算。

探測真實性

想要提升神經(jīng)網(wǎng)絡(luò)的真實性,首先需要判斷模型的激活空間內(nèi)是否存在能真實性或事實性。

識別網(wǎng)絡(luò)內(nèi)部表征的一個常用工具是探測(probe),即在網(wǎng)絡(luò)激活上訓(xùn)練一個分類器作為探測器以區(qū)分特定類型的輸入或輸出。

在事實性檢測上,探測器主要檢查可以區(qū)分真、假答案的注意力頭輸出值。

于TruthfulQA中的每個樣本,研究人員將問題/答案串聯(lián)在一起,并在最后一個token處取出頭部激活作為探測數(shù)據(jù)集;然后將數(shù)據(jù)集按4 : 1隨機分成訓(xùn)練集和驗證集,在訓(xùn)練集上擬合一個二元線性分類器,并使用驗證精度來衡量每個頭與基準數(shù)據(jù)性能之間的關(guān)系。

實驗結(jié)果展現(xiàn)了跨注意力頭的專用模式,對于每層的多個頭,線性探測可以達到基線模型的準確性,不過還是顯示出強大性能的潛力,比如準確率最高的是由第14層的第18個頭實現(xiàn)的,驗證準確性為83.3%

此外,還可以看到各層之間的差異:信息主要是在前面的層中處理的,每層內(nèi)部都有一小部分注意力頭脫穎而出。

通過類似主成分分析(PCA)的方法,可以將激活空間內(nèi)的維度降低到2,并進行可視化,可以觀察到「真實」的概念不止存在于一個方向,而是存在于一個子空間內(nèi)。

推理-時間干預(yù)

上述探測實驗描述LLM如何在其注意頭之間和內(nèi)部處理與事實有關(guān)的信息,還提出了一種改善基準數(shù)據(jù)集性能的技術(shù)。

如果在推理過程中進行干預(yù),使激活向「真實」的方向轉(zhuǎn)變,那么網(wǎng)絡(luò)就有可能對基準問題提供更真實的答案。

首先,研究人員并沒有選擇對所有注意力頭進行干預(yù),因為只有一部分注意力頭與真實性密切相關(guān),而是只對前K個頭的結(jié)果進行干預(yù),以使其具有最小的侵略性。

第二個問題在于如何確定用于變換特定頭部輸出的激活的矢量,因為真、假語句的幾何形狀都很復(fù)雜,在選擇變換激活的方向時,可以選擇與探測學(xué)到的分離超平面正交的向量,他也可以選擇連接真假分布的平均值的向量,下表中列出了不同干預(yù)方向的比較實驗。

Probe weight方向是通過線性探針找到的方向,在這個方向上進行干預(yù),相當(dāng)于對頭部激活做梯度下降,使其被預(yù)測為真實的概率最大化。

Mass Mean Shift的工作原理是首先計算真實和虛假激活的平均值,然后使用從虛假平均值指向真實平均值的向量進行干預(yù)。

對比一致搜索(CCS)為在只知道內(nèi)部激活成對信息的情況下找到的方向。

研究人員在TruthfulQA上訓(xùn)練CCS,對每個問題抽取一個真實的和一個錯誤的答案,由于CCS不接受有標(biāo)簽的輸入,所以發(fā)現(xiàn)的方向有同等的機會成為真實和虛假的方向,然后使用標(biāo)簽來識別真實的方向以進行干預(yù)。

研究人員首先通過驗證集上的探測精度對所有注意力頭的真假相關(guān)度進行排序。把前K個頭作為目標(biāo)集合;然后利用訓(xùn)練集和驗證集的激活,估計沿真實方向的激活的標(biāo)準偏差。

ITI是MHA的一種替代形式,對于未被選中的注意頭,θ是一個零向量,相當(dāng)于將激活沿真實方向移動α倍的標(biāo)準差。

整個過程對每次next token預(yù)測都是自回歸地重復(fù)的,并且與解碼算法的選擇是正交的。

公式中有兩個關(guān)鍵參數(shù),即干預(yù)的注意力頭數(shù)量K和干預(yù)強度α,不過目前還沒有關(guān)于最佳值的理論論證,只能通過實驗探索參數(shù)的影響,并通過標(biāo)準的超參數(shù)掃描確定最佳值。

從計算效率角度來看,無論干預(yù)了多少個注意力頭,ITI只會在每一層增加一個常數(shù)向量,可以認為干預(yù)措施的計算開銷接近于零。

實驗部分

用于對比的基線方法如下:

1. 有監(jiān)督微調(diào)(SFT)

SFT是RLHF的第一階段,研究人員用問題作為提示,用交叉熵損失促使模型生成真實的答案,并懲罰錯誤的答案。

但如果只用上述操作,交叉熵損失和KL散度會急劇上升,所以還需要交替對問答進行有監(jiān)督訓(xùn)練和對開放網(wǎng)絡(luò)文本進行預(yù)訓(xùn)練。

2. 少樣本提示(FSP)

有研究人員發(fā)現(xiàn),與上下文蒸餾和RLHF相比,indistribution 50-shot提示在TruthfulQA上也是一個有競爭力的基線方法。

但由于提示策略的選擇與推理時間控制方法是正交的,研究人員對比了有ITI和無ITI的少樣本提示。

3. 指令微調(diào)(IFT)

為了了解ITI如何使IFT模型更加真實,研究人員主要選擇了兩個基于LaMA-7B的模型(Alpaca和Vicuna)執(zhí)行ITI操作。

研究人員首先尋找控制干預(yù)強度的超參數(shù)最佳值,最后確定K=48和α=15

從結(jié)果來看,少樣本提示與ITI的結(jié)合取得了最佳結(jié)果。

將ITI應(yīng)用于指令微調(diào)模型,尋找并干預(yù)其真實性方向的實驗中可以看到,ITI明顯比基線提高了真實性,還可以被應(yīng)用在少樣本提示或指令微調(diào)之上,不過代價是CE損失和KL散度提升相對較低

參考資料:

https://the-decoder.com/honest-llama-new-method-could-make-chatgpt-more-truthful/

相關(guān)稿件

熱訊:ChatGPT說謊竟然是故意的?哈佛大學(xué)提出ITI:模型真實性翻倍,計算開銷基本為零

實時焦點:產(chǎn)后腰痛是為什么?

瓦格納創(chuàng)始人被訴武裝叛亂,俄國民警衛(wèi)隊中央?yún)^(qū)軍官進入緊急狀態(tài)

撿兩張angelababy的照片 angelababy真的可以駕馭各種風(fēng)格啊!

金碧輝煌!港知名反派曬內(nèi)地別墅全屋猶如宮殿,未有娶妻一直獨居 全球快播報

玩法“上新” “暑期檔”旅游持續(xù)升溫

車險手續(xù)費“價格戰(zhàn)”消費者獲利了嗎?

今起多地高考出分!

今日熱文:意大利海域發(fā)生移民船沉沒事故 或有40人失蹤

環(huán)球快看:關(guān)愛海員 72家服務(wù)船員陣地清單公布

石斛有什么作用和功效(石斛好處有哪些)|環(huán)球最新

我國北部和東部海域?qū)⒂?-7級風(fēng) 南部沿岸海域?qū)⒂欣妆┐箫L(fēng)

微頭條丨內(nèi)蒙古租賃房拆遷律師費用怎么算

賞美景品民俗 多姿多彩過端午 全球即時

天天微速訊:多項產(chǎn)品不合格被通報,小熊電器怎么了?

最高法首次發(fā)布涉體育糾紛民事典型案例

白玉蘭最有爭議的4次視后之爭,趙麗穎輸給吳越,梅婷敗北孫儷_當(dāng)前短訊

浙江商業(yè)職業(yè)技術(shù)學(xué)院藝術(shù)設(shè)計學(xué)院:推動多維教學(xué) 與資源庫建設(shè)融合發(fā)展

溫馨提示:如何結(jié)合高考成績選擇學(xué)校_世界實時

美國一火車在橋梁坍塌后落入河中 載有硫磺等危險化學(xué)品|消息

聚焦幼兒“三性” 創(chuàng)設(shè)互動環(huán)境

速遞!5年期LPR為何只降10個基點?

【全球新視野】省實驗中學(xué)這名考生數(shù)學(xué)物理都是滿分

【環(huán)球新視野】全球矚目!R+T Asia與你共迎海內(nèi)外客商回歸

杭州亞運會物流中心啟用 “信息系統(tǒng)+智能裝備”高效協(xié)同_全球百事通

銀川燒烤店燃氣爆炸事故原因公布_天天報資訊

湖北省興山縣古昭公路成為鄂西一道旅游風(fēng)景線

“警馬”出戰(zhàn) 傾力護跑

端午節(jié)假期出游人次破億 天天快播報

【天天快播報】世界上讓人毛骨悚然的10個巧合,看完相信“冥冥之中自有天意”


主站蜘蛛池模板: 久久99国产精品99久久| 精品国产一区二区三区在线| 国产免费一区视频观看免费| 国产精品久久久久久久久久三级 | 日韩一级免费在线观看| 五月婷婷一区| 免费人成在线观看视频播放| 欧美日韩一区二区视频在线观看 | 欧美日韩国产一二| 欧美日韩国产高清视频| 黄色国产精品一区二区三区| 欧美日韩高清在线观看| 日韩a∨精品日韩在线观看| 91精品国产综合久久久久久蜜臀| 99久久国产免费免费| 久久躁狠狠躁夜夜爽| 91国产一区在线| 日本午夜精品电影| 国产精品亚发布| 日本一区二区三区在线播放| 国产日韩欧美在线观看| 欧美精品999| 欧美二区在线| 九九热精品视频| 久久综合狠狠综合久久综青草| 国产亚洲欧美在线视频| 国产精品美女视频网站| 韩国视频理论视频久久| 一区二区不卡视频| 日韩国产一区久久| 在线免费一区| 精品久久久久久综合日本| 日本一区二区视频| 国产精品美女诱惑| 日韩中文字幕精品视频| 视频一区二区三区免费观看| 成人精品网站在线观看| 久久久亚洲福利精品午夜| 亚洲欧美日韩精品综合在线观看| 亚洲最大av在线| 国产精品露脸av在线|