Benchmark — разрушитель LLM'ок, или Как мы собрали свой мультиязычный SWE-Bench

В статье представлено многоязычное расширение SWE-Bench от команды Doubletapp — бенчмарка для оценки больших языковых моделей (LLM) на реальных задачах программной инженерии, на различных языках программирования и кодовых базах индустрии. О процессе сбора SWE-Bench мы уже рассказывали в отдельной статье, а здесь сосредоточимся на результатах тестирования. Мы оцениваем ряд ведущих открытых LLM, предоставляя подробный количественный и качественный анализ, а также рассматриваем, как качество бенчмарка влияет на достоверность и объективность оценки моделей.

Содержание
• Общая информация о датасете
• Стенд для тестирования
• Результаты
• Заключение

📌 Похожие новости

Как OpenAI передаёт ИИ «голос общества»: итоги коллективного эксперимента

Организация датасетов с ClearML

FineBi Динамическая фильтрация данных

Фильтры и сортировка