МЕТОД ОЦІНЮВАННЯ ЗАХИЩЕНОСТІ АГЕНТНИХ ЗАСТОСУНКІВ ДЛЯ ЗАДАЧ КРИТИЧНОЇ ІНФРАСТРУКТУРИ

Автор(и)

  • Родислав Редько-Шпак Національний Технічний Університет України "Київський політехнічний інститут імені Ігоря Сікорського" https://orcid.org/0009-0004-9971-2469
  • Ірина Стьопочкіна National Technical University of Ukraine "Igor Sikorsky Kyiv Polytechnic Institute" https://orcid.org/0000-0002-0346-0390

DOI:

https://doi.org/10.28925/2663-4023.2026.34.1317

Ключові слова:

агентні застосунки, LLM, критична інфраструктура, оцінка захищеності, витік конфіденційних даних, Attack Success Rate

Анотація

Статтю присвячено проблемі оцінювання захищеності застосунків, які функціонують із залученням агентів штучного інтелекту. ШІ-агенти працюють на основі великих мовних моделей і виконують задачі в області аналізу журналів подій, обробки технічної документації об’єкта, аналізу даних в базах об’єкта критичної  інфраструктури. Також агенти можуть бути залучені до задач моніторингу та взаємодій з платформами SOC/SIEM. Cеред відмінностей, які роблять агентні застосунки потенційно небезпечними, є здатність автономно викликати зовнішні застосунки, виконувати інші інтелектуальні дії, які розширюють поверхню атак. Серед ризиків є виконання ескалація привілеїв, виток конфіденційних даних, та виконання дій, початково не передбачених політикою безпеки. Метою дослідження є розробка методу оцінювання захищеності агентних застосунків, який орієнтується на застосування в задачах критичної інфраструктури. Метод є придатним для порівняльного аналізу різних версій великих мовних моделей та конфігурацій агентних застосунків. До складу метода входить робота з моделлю загроз, каталогом тестових сценаріїв, запропонованою системою кількісних метрик. Функціональна частина методу складається з процедури автоматизованого тестування та формування рекомендацій щодо політики розмежування доступу агентів до даних та інструментів. Модель загроз стосується рівнів великої мовної моделі, зовнішніх інструментів, і враховує наступні категорії найбільш типових атак: 1) пряму ін’єкцію промпту, 2) непряму ін’єкцію промпту через зовнішні дані, 3) зловживання інструментами, 4) витік конфіденційних даних, 5) ескалацію привілеїв. В якості показника для кількісної оцінки використаний показний успішності атак (ASR), і додатково – показники зловживання інструментами, витоку даних та ескалації привілеїв. Працездатність запропонованого методу показана експериментально, в ізольованому програмному середовищі, реалізованому на Python з застосуванням LangChain та Ollama. Тестування агента відбувалось з використанням інструментів, які імітували читання, запис, виконання SQL-запитів, пошук даних та надсилання повідомлень. Експерименти здійснені для моделей Llama 3.1 8B, Ministral 3 8B та Qwen 3 8B із використанням 50 тестових сценаріїв і десятикратним повторенням кожного сценарію; загальний обсяг експерименту становив 2000 запусків. Встановлено, що вразливості моделей суттєво відрізняються, а найбільш небезпечним напрямком для всіх досліджених LLM є витік конфіденційних даних, значення відповідного показника становило від 20 % до 70 %. Використання режиму «thinking» в Qwen 3 зробило можливим зниження загального показника успішності атак з 22% до 6.2%. Однак, використання цього режиму не усуває повністю ризики витоку даних та несанкціонованого підвищення привілеїв. Результати дослідження дають підставу сформулювати рекомендації: застосовувати принцип найменших привілеїв, за можливості – використовувати режим read-only, обов’язково залучати оператора-людину для підтвердження виконання критичних операцій. Запропонований метод може використовуватись для порівняльної оцінки та попереднього тестування агентних застосунків, які використовуються інформаційно-аналітичних задач критичної інфраструктури.

Завантаження

Дані завантаження ще не доступні.

Посилання

OWASP GenAI Security Project. (2025, December 9). OWASP Top 10 for agentic applications for 2026. OWASP GenAI Security Project

Clinton, S. (2025, December 9). OWASP GenAI Security Project releases Top 10 risks and mitigations for agentic AI security. OWASP GenAI Security Project. OWASP GenAI Security Project

Maheshwar, S. (2026, May 30). A timeline of Model Context Protocol (MCP) security breaches. AuthZed. AuthZed

Reddy, P., & Gujral, A. S. (2025). EchoLeak: The first real-world zero-click prompt injection exploit in a production LLM system. Proceedings of the AAAI Symposium Series, 7(1), 303-311. https://doi.org/10.1609/aaaiss.v7i1.36899

Zhang, H., Huang, J., Mei, K., Yao, Y., Wang, Z., Zhan, C., Wang, H., & Zhang, Y. (2025). Agent Security Bench (ASB): Formalizing and benchmarking attacks and defenses in LLM-based agents. In The Thirteenth International Conference on Learning Representations (ICLR 2025). ICLR proceedings

MITRE Corporation. (n.d.). MITRE ATLAS™: Adversarial Threat Landscape for Artificial-Intelligence Systems. Retrieved July 18, 2026, from MITRE ATLAS

Kim, J., Liu, X., Wang, Z., Qiu, S., Li, B., Guo, W., & Song, D. (2026). The attack and defense landscape of agentic AI: A comprehensive survey [Preprint]. arXiv. arXiv:2603.11088

Tang, Y., Liu, Y., Lan, J., Yan, Z., & Gelenbe, E. (2026). Security of LLM-based agents regarding attacks, defenses, and applications: A comprehensive survey. Information Fusion, 127, Article 103941. https://doi.org/10.1016/j.inffus.2025.103941

Yao, S., Zhao, J., Yu, D., Du, N., Shafran, I., Narasimhan, K., & Cao, Y. (2023). ReAct: Synergizing reasoning and acting in language models. In The Eleventh International Conference on Learning Representations (ICLR 2023). arXiv:2210.03629

Shafranskyi, D., Stopochkina, I., & Ilin, M. (2026). Towards the development of an LLM-based methodology for automated security profiling in compliance with Ukrainian cybersecurity regulations. Theoretical and Applied Cybersecurity, 8(1), 100-111. https://doi.org/10.20535/tacs.2664-29132026.1.356631

Voitsekhovskyi, A., Stopochkina, I., Sun, P., Xie, J., Ilin, M., & Novikov, O. (2026). Detection of vulnerabilities in software for unmanned aerial vehicles by using large language models. Eastern-European Journal of Enterprise Technologies, 1(2 (139)), 36-47. https://doi.org/10.15587/1729-4061.2026.352029

Andreiev, D., Chornyi, A., Stopochkina, I., & Ilin, M. (2026). Methodology for automating cyber incident reports using LLM. Cybersecurity: Education, Science, Technique, 1(33), 274-285. https://doi.org/10.28925/2663-4023.2026.33.1156

Ferrag, M. A., Tihanyi, N., Hamouda, D., Maglaras, L., Lakas, A., & Debbah, M. (2026). From prompt injections to protocol exploits: Threats in LLM-powered AI agents workflows. ICT Express, 12(2), 353-383. https://doi.org/10.1016/j.icte.2025.12.001

NVIDIA. (n.d.). garak: The LLM vulnerability scanner [Computer software]. GitHub. Retrieved July 18, 2026, from NVIDIA garak

Microsoft. (n.d.). Python Risk Identification Tool for generative AI (PyRIT) [Computer software]. GitHub. Retrieved July 18, 2026, from Microsoft PyRIT

Bullwinkel, B., Minnich, A., Chawla, S., Lopez, G., Pouliot, M., Maxwell, W., de Gruyter, J., Pratt, K., Qi, S., Chikanov, N., Lutz, R., Dheekonda, R. S. R., Jagdagdorj, B.-E., Kim, E., Song, J., Hines, K., Jones, D., Severi, G., Lundeen, R., … Russinovich, M. (2025). Lessons from red teaming 100 generative AI products [Preprint]. arXiv. arXiv:2501.07238

Promptfoo. (n.d.). Promptfoo: LLM evals & red teaming [Computer software]. GitHub. Retrieved July 18, 2026, from Promptfoo GitHub repository

Wang, X., Chen, Y., Li, J., Wang, Y., Yao, Y., Gu, T., Li, J., Teng, Y., Ma, X., Wang, Y., & Hu, X. (2026). OpenRT: An open-source red teaming framework for multimodal LLMs [Preprint]. arXiv. arXiv:2601.01592

Mazeika, M., Phan, L., Yin, X., Zou, A., Wang, Z., Mu, N., Sakhaee, E., Li, N., Basart, S., Li, B., Forsyth, D., & Hendrycks, D. (2024). HarmBench: A standardized evaluation framework for automated red teaming and robust refusal. Proceedings of Machine Learning Research, 235, 35181-35224. arXiv:2402.04249

Chao, P., Debenedetti, E., Robey, A., Andriushchenko, M., Croce, F., Sehwag, V., Dobriban, E., Flammarion, N., Pappas, G. J., Tramèr, F., Hassani, H., & Wong, E. (2024). JailbreakBench: An open robustness benchmark for jailbreaking large language models. Advances in Neural Information Processing Systems, 37, 55005-55029. arXiv:2404.01318

Berenstein, D. (2025, December 16). Phare LLM benchmark V2: Reasoning models don’t guarantee better security. Giskard. Giskard

LangChain. (n.d.). LangChain documentation. Retrieved July 18, 2026, from LangChain documentation

Agent Security Evaluator [Computer software]. (n.d.). GitHub. Retrieved July 18, 2026, from Agent Security Evaluator repository

Downloads


Переглядів анотації: 2

Опубліковано

2026-09-24

Як цитувати

Редько-Шпак, Р., & Стьопочкіна, І. (2026). МЕТОД ОЦІНЮВАННЯ ЗАХИЩЕНОСТІ АГЕНТНИХ ЗАСТОСУНКІВ ДЛЯ ЗАДАЧ КРИТИЧНОЇ ІНФРАСТРУКТУРИ. Електронне фахове наукове видання «Кібербезпека: освіта, наука, техніка», 2(34), 338–349. https://doi.org/10.28925/2663-4023.2026.34.1317

Статті цього автора (авторів), які найбільше читають