Дисертаційну роботу присвячено розробленню та дослідженню методів машинного навчання на основі моделі Transformer для виявлення падінь людини за даними інерційних сенсорів (IMU) та відеопотоку. Падіння є однією з провідних причин травматизму, госпіталізації та смертності серед людей похилого віку, а також суттєвою проблемою у сфері охорони праці та «розумних» середовищ. Наявні системи виявлення падінь, побудовані на порогових алгоритмах, згорткових і рекурентних нейронних мережах, досягають високої точності на окремих наборах даних, проте характеризуються високою частотою хибних спрацьовувань, обмеженою здатністю до узагальнення на нових суб'єктів, потребою у великих обсягах розмічених даних, ризиками для приватності у відеопідходах та значними обчислювальними витратами. Архітектура Transformer завдяки механізму самоуваги дозволяє моделювати довготривалі залежності, важливі для виявлення короткочасних, але змістовно складних подій, якими є падіння.
Метою роботи є підвищення надійності, рівня приватності та здатності до узагальнення систем виявлення падінь шляхом розроблення комплексу моделей на основі архітектури Transformer, збалансованого набору даних і стратегій розгортання в реальному часі. Об'єктом дослідження є процеси автоматизованого виявлення падінь людини за даними інерційних сенсорів та відеопотоку; предметом — методи та моделі машинного навчання на основі архітектури Transformer для виявлення падінь, зокрема суб'єктно-незалежного та неконтрольованого, з урахуванням приватності й апаратних обмежень. Використано методи машинного та глибинного навчання, цифрової обробки сигналів і часових рядів, комп'ютерного зору, теорії ймовірностей і математичної статистики, теорії екстремальних значень (EVT), а також протоколи оцінювання Leave-One-Subject-Out та ROC/PR-аналіз.
Сформовано власний збалансований мультимодальний набір даних із 8 953 розмічених зразків (2 791 падіння та 6 162 епізоди повсякденної активності) від 29 учасників; показано, що додавання барометричних даних до акселерометричних підвищує точність класифікації. Запропоновано систему відеовиявлення падінь із захистом приватності на основі EfficientNet та LSTM із модулем динамічного розмиття, що забезпечує анонімізацію особи без суттєвого зниження точності. Виконано порівняльне оцінювання семи трансформерних архітектур (Informer, Performer, Linformer, Temporal Convolutional Transformer та інших) у єдиних експериментальних умовах, де найкращі моделі досягли повноти виявлення, близької до 100 %. Реалізовано трансформерну модель у реальному часі на System-on-Chip (Raspberry Pi Zero 2 W) із затримкою інференсу близько 34 мс та інтегрованою кібербезпековою рамкою (шифрування AES-256, блокчейн). Застосовано Vision Transformer із просторово-часовою самоувагою для відеоаналізу, причому карти уваги забезпечують інтерпретованість прогнозів. Розроблено суб'єктно-незалежний метод неконтрольованого виявлення падінь на основі маскованого Transformer та комбінованої енергетично-реконструкційної функції оцінювання з пороговим визначенням за теорією екстремальних значень; метод навчається виключно на послідовностях повсякденної активності та за протоколом LOSO досягає ROC-AUC 0,985, PR-AUC 0,955 і чутливості 95,8 % на рівні подій.
Наукова новизна полягає в тому, що вперше розроблено суб'єктно-незалежний метод неконтрольованого виявлення падінь на основі маскованого Transformer та комбінованої енергетично-реконструкційної функції оцінювання з пороговим визначенням за теорією екстремальних значень, який не потребує розмічених прикладів падінь; вперше запропоновано порівняльну методологію бенчмаркінгу трансформерних архітектур для виявлення падінь за даними акселерометра в єдиних експериментальних умовах. Удосконалено архітектурне рішення для виявлення падінь у реальному часі на System-on-Chip із механізмами кібербезпеки, а також підхід до виявлення падінь за відеоданими на основі Vision Transformer. Дістали подальшого розвитку методи захисту приватності у відеоаналізі на основі EfficientNet та LSTM і підходи до формування збалансованих мультимодальних наборів даних.
Практичне значення отриманих результатів полягає в тому, що запропоновані методи можуть бути застосовані у системах моніторингу літніх людей, охорони здоров'я, безпеки на виробництві, «розумних» будинках, носимих пристроях та системах відеоспостереження зі збереженням приватності. Сформований набір даних і відкритий програмний код забезпечують відтворюваність результатів. Практичну цінність підтверджено патентом України на корисну модель пристрою для виявлення падіння та автоматичного сповіщення рідних.
Ключові слова: виявлення падінь, модель Transformer, машинне навчання, глибинне навчання, часові ряди, IMU, Vision Transformer, комп'ютерний зір, неконтрольоване навчання, виявлення аномалій, суб'єктно-незалежне виявлення, захист приватності, крайові обчислення, вбудовані системи.