Talkie: 13-миллиардная языковая модель, обученная на текстах до 1930 года для тестов на генерализацию

Исследователи выпустили Talkie — языковую модель на 13B параметров, натренированную на 260 миллиардах токенов текста, изданного строго до 1930 года. Выбор временной отсечки прагматичен: все американские тексты старше этого периода перешли в общественное достояние. Главная ценность такого датасета заключается в создании стерильной среды для оценки LLM. Современные модели впитывают весь веб, из-за чего сложно проверить их способность к самостоятельному выводу концепций. Talkie лишена проблемы контаминации данных по дизайну.
Изоляция от современного контекста позволяет тестировать чистую генерализацию. Авторы прогнали модель без знаний о цифровых компьютерах через бенчмарк HumanEval для тестирования написания кода на Python. Получив несколько примеров в контексте, винтажная LLM справляется с базовыми однострочными скриптами — например, инвертирует функцию шифрования, заменяя сложение на вычитание. Параллельно исследователи замеряют способность предсказывать будущее. Метрика неожиданности текста для нейросети стабильно растет при чтении исторических сводок вплоть до 1960-х годов, после чего выходит на плато.
Для калибровки результатов команда обучила идентичного архитектурного близнеца на современном датасете FineWeb. Историческая версия ожидаемо уступает современной в базовых бенчмарках, но удаление анахроничных вопросов из тестов сокращает разрыв в метриках вдвое. Сейчас авторы готовят масштабирование проекта до объема GPT-3, а сборка архива размером свыше 1T токенов в перспективе позволит получить винтажную модель уровня оригинального ChatGPT.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад