Проблема генерации синтетических данных при формировании big data в животноводстве

УДК 636:004.8

Е.Г. Скворцова, Е.А. Скворцов

Аннотация. В статье рассматривается проблема генерации синтетических данных как ключевое направление развития технологий больших данных в животноводстве. Проанализированы основные причины дефицита качественных размеченных данных: высокая стоимость сбора, этические ограничения, редкость патологических состояний и несоблюдение принципов FAIR. Систематизированы современные методы генерации синтетических данных, включая генеративно-состязательные сети (GAN), вариационные автоэнкодеры (VAE), вероятностные методы на основе копула-функций и рангподходы. Особое внимание уделено архитектурным решениям для сохранения корреляционных структур и обеспечения биологической правдоподобности генерируемых данных. На основе анализа научной литературы выявлены основные вызовы: проблема специфичности моделей к типам распределений, риски внесения артефактных взаимосвязей и необходимость многоуровневого контроля качества. Определены перспективные направления исследований, включая гибридные подходы, сочетающие преимущества процедурной генерации и глубокого обучения, а также разработку специализированных метрик оценки качества синтетических данных в животноводстве.

Ключевые слова: синтетические данные, большие данные, животноводство, генеративно-состязательные сети, вариационные автоэнкодеры, дефицит данных, GAN, VAE, контроль качества, корреляционные структуры. 

  

Скачать полный текст статьи