自拍偷在线精品自拍偷,亚洲欧美中文日韩v在线观看不卡

大模型“自動修 bug”能力將提升,豆包團隊開源首個多語言代碼修復(fù)基準(zhǔn) Multi-SWE-bench

人工智能 開源
4 月 10 日消息,豆包大模型團隊今日通過官方公眾號宣布,首個多語言類 SWE 數(shù)據(jù)集 Multi-SWE-bench 現(xiàn)已正式開源,可用于評估和提升大模型“自動修 Bug”能力。

4 月 10 日消息,豆包大模型團隊今日通過官方公眾號宣布,首個多語言類 SWE 數(shù)據(jù)集 Multi-SWE-bench 現(xiàn)已正式開源,可用于評估和提升大模型“自動修 Bug”能力。

在 SWE-bench 基礎(chǔ)上,Multi-SWE-bench 首次覆蓋 Python 之外的 7 種主流編程語言,是真正面向“全棧工程”的評測基準(zhǔn)。其數(shù)據(jù)均來自 GitHub issue,歷時近一年構(gòu)建,以盡可能準(zhǔn)確測評和提高大模型高階編程智能水平。

Multi-SWE-bench 旨在推動自動編程技術(shù)從僅能解決單一語言(如 Python)和低復(fù)雜度的任務(wù),朝著支持多語言、具備真實問題解決能力的通用型智能體邁進(jìn)。

SWE-bench 是當(dāng)前最具代表性的代碼修復(fù)評測基準(zhǔn),強調(diào)任務(wù)真實、難度高。它基于 GitHub issue,要求模型自動定位并修復(fù) Bug,兼具跨文件修改、復(fù)雜語義推理與上下文理解等挑戰(zhàn)。

Multi-SWE-bench 旨在補全現(xiàn)有同類基準(zhǔn)語言覆蓋方面的不足,系統(tǒng)性評估大模型在復(fù)雜開發(fā)環(huán)境下的“多語言泛化能力”,推動多語言軟件開發(fā) Agent 的評估與研究,其主要特性如下:

  • 首次覆蓋 7 種主流編程語言(包括 Java、Go、Rust、C、C++、TypeScript、JavaScript),構(gòu)建多語言開發(fā)環(huán)境下的代碼修復(fù)任務(wù),系統(tǒng)評估模型的跨語言適應(yīng)與泛化能力;
  • 引入任務(wù)難度分級機制,將問題劃分為簡單(Easy)、中等(Medium)和困難(Hard)三類,涵蓋從一行修改到多文件、多步驟、多語義依賴的開發(fā)挑戰(zhàn);
  • 1,632 個實例全部來源于真實開源倉庫,并經(jīng)過統(tǒng)一的測試標(biāo)準(zhǔn)和專業(yè)開發(fā)者的審核篩選,確保每個樣本具備清晰的問題描述、正確的修復(fù)補丁以及可復(fù)現(xiàn)的運行測試環(huán)境。

IT之家附開源鏈接:

Multi-SWE-bench: A Multilingual Benchmark for Issue Resolving:

責(zé)任編輯:龐桂玉 來源: IT之家
相關(guān)推薦

2024-09-29 13:10:08

2024-11-02 10:28:03

2023-07-05 09:57:11

2024-07-15 07:52:00

2024-11-01 20:25:28

2024-12-05 15:22:19

2021-06-29 21:48:32

開源語言架構(gòu)

2024-12-05 12:26:28

2024-03-04 14:15:16

OpenAI語言嵌入模型

2024-03-19 13:12:36

自動駕駛模型

2024-11-25 15:30:00

語言模型數(shù)據(jù)

2025-02-17 14:43:51

2014-04-16 14:50:20

Spark

2025-03-05 08:40:00

2024-02-23 11:27:00

數(shù)據(jù)技術(shù)

2019-12-05 16:00:15

Vim插件編程文本編輯器

2012-04-19 11:40:21

Titanium

2009-08-25 10:44:50

C#實現(xiàn)多語言

2011-08-05 17:54:33

Cocoa Touch 多語言

2014-07-09 09:20:06

WPFWPF應(yīng)用
點贊
收藏

51CTO技術(shù)棧公眾號