Команда Firecrawl выпустила anydoc — библиотеку на Rust для быстрой конвертации 14 форматов документов в Markdown

Команда Firecrawl представила anydoc — библиотеку с открытым исходным кодом, написанную на Rust. Инструмент предназначен для парсинга офисных документов и их конвертации в чистый Markdown, при этом медианное время обработки одного файла составляет менее пяти миллисекунд. Движок работает локально без использования внешних ML-моделей, что означает высокую скорость и независимость от сторонних сервисов.
Библиотека поддерживает 14 форматов, включая Word, PowerPoint, Excel, EPUB и PDF, преобразуя их через единую внутреннюю модель документа. Формат исходного файла определяется по сигнатурам байтов, а не по расширению, в результате чего даже некорректно названные файлы обрабатываются без ошибок. На выходе сохраняется полная структура текста: заголовки с якорями, таблицы со слитыми ячейками, внутренние перекрестные ссылки, а также сноски и встроенные объекты.
Инструмент поставляется с готовыми биндингами для Node.js, Python и WebAssembly, позволяя запускать конвертацию непосредственно в браузере без отправки данных на сервер. Кроме того, anydoc упакован как навык для ИИ-агентов через протокол Agent Skills, благодаря чему такие среды разработки, как Claude Code или Cursor, получают прямой доступ к чтению локальных файлов в оптимизированном для LLM формате.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад