
В первых двух статьях цикла мы разобрались, почему нормативно-справочная информация (НСИ) неизбежно деградирует, почему простые алгоритмы сравнения строк проигрывают AI/ML, и как устроен сервис SOFROS AI/ML в целом — его архитектура, гибридный подход и интеграция с корпоративными системами через REST API.
Но методология и архитектура — это лишь верхушка айсберга. Главная магия происходит внутри моделей, которые отвечают за классификацию, извлечение характеристик, семантический поиск и контекстное обогащение данных. Именно они превращают «сырые» записи в структурированные и нормализованные справочники.
В третьей статье мы заглянем под капот этих моделей и подробно разберём:
- как работает модель классификации на основе наивного байесовского классификатора с учётом опечаток, n-грамм и нечёткого поиска;
- как модель экстракции выделяет именованные сущности (NER) с помощью spaCy и beam search;
- как модель семантического поиска использует BERT, FAISS и реранкер для поиска по смыслу;
- как модель контекстного поиска обращается к веб-источникам для дообогащения данных;
- зачем нужна классификация PII и как она обеспечивает безопасность.
Читать далее
Комментарии 0
Войдите, чтобы оставить комментарий