ЗДЕСЬ медиа
github.com

watermarks-remover: утилита для очистки текстов и файлов от скрытых AI-маркеров и метаданных

Опубликован watermarks-remover — инструмент с открытым исходным кодом для удаления скрытых маркеров происхождения контента, которые внедряют генеративные нейросети. Утилита очищает тексты от невидимых символов Unicode, специфических пробелов и двунаправленного форматирования, а также нейтрализует статистические водяные знаки, характерные для моделей Claude, Gemini (включая SynthID) и OpenAI. Нейтрализация текстовых маркеров происходит за счет переписывания контента с использованием опциональных хуков и локальных моделей.

Помимо работы с сырым текстом, система поддерживает очистку метаданных из файлов форматов PNG, JPEG, SVG, PDF, DOCX, HTML и Markdown. На этом уровне алгоритм вырезает C2PA-манифесты, EXIF, XMP и внутренние свойства документов. Для глубокой очистки PDF-файлов и полной перестройки их структуры инструмент автоматически задействует системную утилиту qpdf, что минимизирует риск восстановления удаленных трекинговых данных.

Архитектурно проект реализован как HTTP-сервис на базе стандартной библиотеки Python 3.10+, не требующий сторонних зависимостей. Это позволяет интегрировать его как локальный навык для AI-агентов или запускать в изолированных контейнерах Docker. Взаимодействие происходит через REST API или набор консольных скриптов, таких как clean_file.py и rewrite_text.py. При этом сервис автоматически определяет тип контента по сигнатурам файлов, предотвращая повреждение бинарных контейнеров при попытке текстовой обработки.

Поделиться:

Telegram

Ещё из архива

Все публикации