自拍偷在线精品自拍偷,亚洲欧美中文日韩v在线观看不卡

<kbd id="bzinh"></kbd>

51CTO首頁(yè)

AI.x社區(qū)

軟考社區(qū)

免費(fèi)課

企業(yè)培訓(xùn)

鴻蒙開(kāi)發(fā)者社區(qū)

WOT技術(shù)大會(huì)

公眾號(hào)矩陣

移動(dòng)端

視頻課免費(fèi)課排行榜短視頻直播課軟考學(xué)堂

全部課程軟考華為認(rèn)證廠商認(rèn)證 IT技術(shù)PMP項(xiàng)目管理免費(fèi)題庫(kù)

在線學(xué)習(xí)

文章資源問(wèn)答課堂專(zhuān)欄直播

51CTO

鴻蒙開(kāi)發(fā)者社區(qū)

51CTO技術(shù)棧

51CTO官微

51CTO學(xué)堂

51CTO博客

CTO訓(xùn)練營(yíng)

鴻蒙開(kāi)發(fā)者社區(qū)訂閱號(hào)

51CTO軟考

51CTO學(xué)堂APP

51CTO學(xué)堂企業(yè)版APP

鴻蒙開(kāi)發(fā)者社區(qū)視頻號(hào)

51CTO軟考題庫(kù)

賬號(hào)設(shè)置退出

可協(xié)助 AI 語(yǔ)言模型改善自我糾錯(cuò)能力，谷歌推出 BIG-Bench Mistake 數(shù)據(jù)集

作者：IT之家 2024-01-15 14:44:19

據(jù)悉，研究人員首先使用 PaLM 語(yǔ)言模型在自家 BIG-Bench 基準(zhǔn)測(cè)試任務(wù)中運(yùn)行了 5 項(xiàng)任務(wù)，之后將生成的“思維鏈（Chain-of-Thought）”軌跡修改加入“邏輯錯(cuò)誤”部分，之后重新丟給模型判斷思維鏈軌跡中哪些地方存在錯(cuò)誤。

IT之家 1 月 15 日消息，谷歌研究院日前使用自家 BIG-Bench 基準(zhǔn)測(cè)試建立了一項(xiàng)“BIG-Bench Mistake”數(shù)據(jù)集，并利用相關(guān)數(shù)據(jù)集對(duì)市面上流行的語(yǔ)言模型“出錯(cuò)概率”及“糾錯(cuò)能力”進(jìn)行了一系列評(píng)估研究。

谷歌研究人員表示，由于過(guò)去沒(méi)有能夠評(píng)估大語(yǔ)言模型“出錯(cuò)概率”及“自我糾錯(cuò)能力”的數(shù)據(jù)集，因此他們創(chuàng)建了一項(xiàng)名為“BIG-Bench Mistake”的專(zhuān)用基準(zhǔn)數(shù)據(jù)集用于評(píng)估測(cè)試。

據(jù)悉，研究人員首先使用 PaLM 語(yǔ)言模型在自家 BIG-Bench 基準(zhǔn)測(cè)試任務(wù)中運(yùn)行了 5 項(xiàng)任務(wù)，之后將生成的“思維鏈（Chain-of-Thought）”軌跡修改加入“邏輯錯(cuò)誤”部分，之后重新丟給模型判斷思維鏈軌跡中哪些地方存在錯(cuò)誤。

為了提升數(shù)據(jù)集準(zhǔn)確程度，谷歌研究人員反復(fù)進(jìn)行上述過(guò)程，最終形成了一項(xiàng)內(nèi)含“255 項(xiàng)邏輯錯(cuò)誤”的“BIG-Bench Mistake”專(zhuān)用基準(zhǔn)數(shù)據(jù)集。

研究人員提到，由于“BIG-Bench Mistake”數(shù)據(jù)集中的邏輯錯(cuò)誤較為“簡(jiǎn)單明確”，因此可以作為一個(gè)良好的測(cè)試標(biāo)準(zhǔn)，可協(xié)助語(yǔ)言模型先從簡(jiǎn)單的邏輯錯(cuò)誤開(kāi)始練習(xí)，逐步提升辨識(shí)錯(cuò)誤的能力。

研究人員利用該數(shù)據(jù)集對(duì)市面上模型進(jìn)行測(cè)試，發(fā)現(xiàn)雖然絕大多數(shù)語(yǔ)言模型可以識(shí)別在推理過(guò)程中出現(xiàn)的邏輯錯(cuò)誤并進(jìn)行自我修正，但這個(gè)過(guò)程“并不夠理想”，通常需要人工干預(yù)來(lái)糾正模型輸出的內(nèi)容。

▲ 圖源谷歌研究院新聞稿

IT之家從報(bào)告中發(fā)現(xiàn)，谷歌聲稱(chēng)“目前最先進(jìn)的大語(yǔ)言模型”自我糾錯(cuò)能力也相對(duì)有限，在相關(guān)測(cè)試結(jié)果中成績(jī)發(fā)揮最好的模型，也僅僅找出了 52.9% 的邏輯錯(cuò)誤。

谷歌研究人員同時(shí)聲稱(chēng)，這一 BIG-Bench Mistake 數(shù)據(jù)集有利于改善模型自我糾錯(cuò)能力，經(jīng)過(guò)相關(guān)測(cè)試任務(wù)微調(diào)后的模型，“即便是小型模型表現(xiàn)也通常比零樣本提示的大模型更好”。

據(jù)此，谷歌認(rèn)為在模型糾錯(cuò)方面，可以使用專(zhuān)有小型模型“監(jiān)督”大型模型，相對(duì)于讓大語(yǔ)言模型學(xué)會(huì)“糾正自我錯(cuò)誤”，部署專(zhuān)用于監(jiān)督大模型的小型專(zhuān)用模型有利于改善效率、降低相關(guān) AI 部署成本，并更便于微調(diào)。

責(zé)任編輯：姜華來(lái)源：漾仔

語(yǔ)言模型 PaLM AI

點(diǎn)贊

51CTO技術(shù)棧公眾號(hào)

業(yè)務(wù)
速覽

媒體

51CTO CIOAge HC3i

社區(qū)

51CTO博客鴻蒙開(kāi)發(fā)者社區(qū) AI.x社區(qū)

教育

51CTO學(xué)堂精培企業(yè)培訓(xùn) CTO訓(xùn)練營(yíng)

<style id="96ubo"></style>