Компания Musubi представила PolicyLM-1.7B — компактную модель искусственного интеллекта для модерации контента в реальном времени. Она должна применять правила платформы к сообщениям менее чем за 50 миллисекунд и, в отличие от многих традиционных систем автоматической модерации, не требовать нового обучения при каждом изменении политики. Разработчики рассчитывают, что такой подход позволит соцсетям быстрее адаптировать правила и анализировать растущие объемы публикаций.
Модель выпущена с открытыми весами, поэтому ее можно запускать самостоятельно. Musubi позиционирует ее как альтернативу классификаторам, которые уже используются социальными платформами для выявления запрещенного или нежелательного контента, рассказывает TechCrunch.
Вместо генерации текста — конкретное решение
PolicyLM-1.7B относится к классу так называемых моделей принятия решений. В отличие от обычных больших языковых моделей, которые генерируют текст, такие системы выдают вероятности исходов или выбирают один из заранее определенных вариантов.
В случае PolicyLM-1.7B задача сведена к бинарной классификации: относится ли сообщение к заданной категории или нет. Например, модель должна уметь оценивать контент по сформулированным правилам платформы, а не просто искать заранее известные слова и выражения.
Ограничение числа возможных ответов позволяет таким моделям работать быстрее и дешевле полноценных языковых моделей, сохраняя при этом гибкость архитектуры трансформеров.
По заявлению Musubi, PolicyLM-1.7B рассчитана на скорость и стоимость, сопоставимые с традиционными ИИ-классификаторами, используемыми в системах модерации. При этом она должна справляться с более сложными правилами без специального обучения под каждую новую задачу.
Правила можно менять без переобучения
Ключевая особенность разработки — возможность задавать критерии модерации обычным английским языком. Команда платформы описывает, какой контент нужно обнаруживать, а модель применяет эти инструкции к сообщениям.
Если правила меняются, разработчикам не требуется заново обучать модель. Это может упростить работу команд, которым приходится регулярно уточнять политику публикаций, реагировать на новые виды нежелательного контента и корректировать критерии оценки.
Сооснователь Musubi и директор компании по искусственному интеллекту Филип Янкович считает, что платформам важно не только удалять уже выявленные нарушения, но и получать более полное представление о происходящем. При стремительном росте объемов контента возможность массово и гибко классифицировать публикации становится особенно полезной.
Однако отсутствие необходимости в переобучении само по себе не гарантирует точности. Качество модерации по-прежнему зависит от того, насколько правильно модель понимает правила и насколько надежно она применяет их к конкретным сообщениям.
От контроля ИИ-агентов к модерации людей
Интерес к моделям принятия решений заметно вырос после сентябрьского выхода Jev от TypeSafe AI. Вскоре собственные разработки этого типа представили OpenAI и Amazon.
Одним из первых направлений применения подобных систем стал контроль поведения ИИ-агентов. Теперь тот же принцип предлагают использовать для оценки действий людей в цифровой среде — прежде всего для модерации сообщений и публикаций.
Впрочем, Янкович утверждает, что интересовался подобными технологиями еще до появления Jev. Он связывает истоки подхода с проектом GLiNER, представленным в 2024 году и предназначенным для распознавания именованных сущностей в тексте.
Musubi не скрывает сходства своей разработки с другими моделями принятия решений. Напротив, компания рассчитывает использовать растущий интерес к этой категории ИИ, чтобы привлечь внимание к PolicyLM-1.7B как к специализированному инструменту модерации с открытыми весами.
Сможет ли такая модель изменить модерацию
Для социальных платформ главное преимущество подобных систем — возможность быстро применять меняющиеся правила к огромному потоку сообщений. Если модель действительно обеспечит заявленные скорость и стоимость, она может стать удобным инструментом для предварительной классификации контента и анализа того, что происходит на платформе.
Но автоматическая классификация не решает всех проблем модерации. Формулировки могут быть неоднозначными, контекст — сложным, а допустимость публикации — зависеть от ситуации. Поэтому способность модели быстро выдать ответ еще не означает, что этот ответ всегда будет правильным.
PolicyLM-1.7B показывает, как развитие ИИ может менять сам подход к модерации: вместо создания отдельного классификатора под каждую задачу платформы получают возможность задавать правила на естественном языке и менять их без нового цикла обучения. Насколько надежно это будет работать на практике, предстоит проверить в реальных условиях.






