Model reference · open weights
osint-stylometry-model is an open-weight embedding model from AtesiT. AxForge deploys and operates it for you on dedicated EU-owned hardware — with the licence handled where one is required.
Available as managed deployment — configured and operated for you on dedicated EU hardware, quoted per deployment.
What it is
| Released by | AtesiT |
|---|---|
| Type | Embedding models |
| Task | Embeddings |
| Parameters (lead) | 23M |
| Context | 512 tokens |
| Runs with | sentence-transformers |
| Released | 2026-08-29 |
| Popularity | 570 downloads / month |
| Licence | Open weights |
About
сленгу, эмодзи и языковым смесям. Создана для задач OSINT · Threat Intelligence · Cyber Threat Attribution · Форензика.
OSINT Stylometry Model — это дообученный энкодер на базе архитектуры Sentence-BERT (Siamese Network), который преобразует произвольный текст (пост, комментарий, сообщение в чате, реплику на форуме) в компактный числовой вектор — так называемый «стилистический отпечаток» (stylistic fingerprint).
Главная идея: два текста, написанных одним и тем же человеком, будут иметь высокую косинусную схожесть векторов, даже если они посвящены совершенно разным темам. И наоборот — тексты разных авторов будут располагаться в векторном пространстве далеко друг от друга, даже если темы совпадают.
Модель специально обучена игнорировать содержание текста и фокусироваться исключительно на форме: пунктуационных привычках, характерных опечатках, любимых жаргонизмах, паттернах использования эмодзи, смешении языков (русский + английский сленг, транслит, leetspeak) и типичной длине предложений. Именно эти признаки психолингвисты и криминалисты называют идиолектом — уникальной речевой манерой человека, которую крайне сложно скрыть или подделать в долгосрочной перспективе.
Стилометрия — один из самых недооценённых инструментов в арсенале аналитика открытых источников. В отличие от метаданных (IP-адреса, geolocation, временные метки), стиль письма невозможно скрыть через VPN или Tor — он «утекает» в каждом сообщении, которое пишет человек. Ниже описаны ключевые сценарии применения этой модели в реальной аналитической практике.
Аналитики OSINT регулярно сталкиваются с ситуацией, когда один и тот же человек администрирует несколько «независимых» анонимных каналов, ведёт параллельные аккаунты на теневых форумах или использует разные никнеймы в разных сообществах для маскировки истинного масштаба своей деятельности. Прямые технические связи (общий IP, устройство, telephone number) часто отсутствуют или тщательно скрыты. Однако стиль письма — пунктуационные привычки, специфические опечатки, повторяющиеся жаргонизмы — остаётся практически неизменным. Сравнивая эмбеддинги постов из разных источников, модель позволяет построить граф вероятных связей между аккаунтами и приоритизировать дальнейшее расследование.
Когда в даркнете появляется очередной дамп базы данных или пост о продаже логов / доступа, аналитику Threat Intelligence важно быстро определить, стоит ли за этим уже известная группировка или новый игрок. Сопроводительные тексты («шапки» дампов, объявления о продаже, коммуникация с потенциальными покупателями) обладают устойчивым стилем. Накопив базу стилистических профилей ранее атрибутированных акторов, можно автоматически сравнивать новые публикации с этой базой и получать вероятностную оценку принадлежности к известной группе — что резко ускоряет процесс атрибуции инцидентов.
Если корпоративный аккаунт, аккаунт инфлюенсера или канал в Telegram скомпрометирован, стиль публикуемых сообщений часто резко меняется: исчезают характерные опечатки, меняется пунктуационная манера, появляется несвойственный автору сленг или, наоборот, излишне «правильный» текст, типичный для мошеннических шаблонов. Модель может использоваться как система раннего оповещения (early warning system), непрерывно сравнивающая новые сообщения с историческим профилем автора и подсвечивающая аномальные отклонения ещё до того, как содержание сообщения станет очевидно подозрительным.
При работе с несколькими анонимными источниками информации критически важно понимать, не является ли один и тот же человек автором нескольких «независимых» вбросов, созданных для придания информации видимости консенсуса (эффект множественного подтверждения). Стилометрический анализ позволяет выявить такие скрытые связи ещё до содержательной фактчекинг-проверки, экономя время аналитика и снижая риск манипуляции через фабрикованный консенсус источников.
В делах, связанных с кибербуллингом, вымогательством, угрозами или мошенничеством, стилометрическая модель может использоваться как вспомогательный количественный инструмент для экспертизы авторства анонимных сообщений. Она не заменяет классическую судебную лингвистическую экспертизу, но предоставляет объективную, воспроизводимую метрику схожести, которая может служить отправной точкой для более глубокого ручного анализа экспертом.
В основе модели лежит подход Siamese Neural Network (сиамская нейросеть) в связке с Contrastive Learning. Интуитивно это работает так:
From the published model card. Full card on the HuggingFace links in the sidebar.
Benchmarks
As published on the model card — the maker's own numbers, not measured by AxForge.
| Task | Dataset | Metric | Score |
|---|---|---|---|
| Author Attribution / Stylometry | — | Accuracy | 0.672 |
| Author Attribution / Stylometry | — | F1 Score | 0.721 |
| Author Attribution / Stylometry | — | ROC AUC | 0.943 |
Using it via the API
Once AxForge deploys osint-stylometry-model for you, it answers on the OpenAI-compatible API — the same base URL and keys as every other model. (osint-stylometry-model below is illustrative; you get the exact model name on deployment.)
$ curl -sS https://api.axforge.ai/v1/embeddings \
-H "Authorization: Bearer $AXFORGE_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"osint-stylometry-model","input":"text to embed"}'
Create an account — your API key is available in the console. 3M free tokens every 30 days with every new account.