МЕТОД ОЦІНЮВАННЯ ЗАХИЩЕНОСТІ АГЕНТНИХ ЗАСТОСУНКІВ ДЛЯ ЗАДАЧ КРИТИЧНОЇ ІНФРАСТРУКТУРИ
DOI:
https://doi.org/10.28925/2663-4023.2026.34.1317Ключові слова:
агентні застосунки, LLM, критична інфраструктура, оцінка захищеності, витік конфіденційних даних, Attack Success RateАнотація
Статтю присвячено проблемі оцінювання захищеності застосунків, які функціонують із залученням агентів штучного інтелекту. ШІ-агенти працюють на основі великих мовних моделей і виконують задачі в області аналізу журналів подій, обробки технічної документації об’єкта, аналізу даних в базах об’єкта критичної інфраструктури. Також агенти можуть бути залучені до задач моніторингу та взаємодій з платформами SOC/SIEM. Cеред відмінностей, які роблять агентні застосунки потенційно небезпечними, є здатність автономно викликати зовнішні застосунки, виконувати інші інтелектуальні дії, які розширюють поверхню атак. Серед ризиків є виконання ескалація привілеїв, виток конфіденційних даних, та виконання дій, початково не передбачених політикою безпеки. Метою дослідження є розробка методу оцінювання захищеності агентних застосунків, який орієнтується на застосування в задачах критичної інфраструктури. Метод є придатним для порівняльного аналізу різних версій великих мовних моделей та конфігурацій агентних застосунків. До складу метода входить робота з моделлю загроз, каталогом тестових сценаріїв, запропонованою системою кількісних метрик. Функціональна частина методу складається з процедури автоматизованого тестування та формування рекомендацій щодо політики розмежування доступу агентів до даних та інструментів. Модель загроз стосується рівнів великої мовної моделі, зовнішніх інструментів, і враховує наступні категорії найбільш типових атак: 1) пряму ін’єкцію промпту, 2) непряму ін’єкцію промпту через зовнішні дані, 3) зловживання інструментами, 4) витік конфіденційних даних, 5) ескалацію привілеїв. В якості показника для кількісної оцінки використаний показний успішності атак (ASR), і додатково – показники зловживання інструментами, витоку даних та ескалації привілеїв. Працездатність запропонованого методу показана експериментально, в ізольованому програмному середовищі, реалізованому на Python з застосуванням LangChain та Ollama. Тестування агента відбувалось з використанням інструментів, які імітували читання, запис, виконання SQL-запитів, пошук даних та надсилання повідомлень. Експерименти здійснені для моделей Llama 3.1 8B, Ministral 3 8B та Qwen 3 8B із використанням 50 тестових сценаріїв і десятикратним повторенням кожного сценарію; загальний обсяг експерименту становив 2000 запусків. Встановлено, що вразливості моделей суттєво відрізняються, а найбільш небезпечним напрямком для всіх досліджених LLM є витік конфіденційних даних, значення відповідного показника становило від 20 % до 70 %. Використання режиму «thinking» в Qwen 3 зробило можливим зниження загального показника успішності атак з 22% до 6.2%. Однак, використання цього режиму не усуває повністю ризики витоку даних та несанкціонованого підвищення привілеїв. Результати дослідження дають підставу сформулювати рекомендації: застосовувати принцип найменших привілеїв, за можливості – використовувати режим read-only, обов’язково залучати оператора-людину для підтвердження виконання критичних операцій. Запропонований метод може використовуватись для порівняльної оцінки та попереднього тестування агентних застосунків, які використовуються інформаційно-аналітичних задач критичної інфраструктури.
Завантаження
Посилання
OWASP GenAI Security Project. (2025, December 9). OWASP Top 10 for agentic applications for 2026. OWASP GenAI Security Project
Clinton, S. (2025, December 9). OWASP GenAI Security Project releases Top 10 risks and mitigations for agentic AI security. OWASP GenAI Security Project. OWASP GenAI Security Project
Maheshwar, S. (2026, May 30). A timeline of Model Context Protocol (MCP) security breaches. AuthZed. AuthZed
Reddy, P., & Gujral, A. S. (2025). EchoLeak: The first real-world zero-click prompt injection exploit in a production LLM system. Proceedings of the AAAI Symposium Series, 7(1), 303-311. https://doi.org/10.1609/aaaiss.v7i1.36899
Zhang, H., Huang, J., Mei, K., Yao, Y., Wang, Z., Zhan, C., Wang, H., & Zhang, Y. (2025). Agent Security Bench (ASB): Formalizing and benchmarking attacks and defenses in LLM-based agents. In The Thirteenth International Conference on Learning Representations (ICLR 2025). ICLR proceedings
MITRE Corporation. (n.d.). MITRE ATLAS™: Adversarial Threat Landscape for Artificial-Intelligence Systems. Retrieved July 18, 2026, from MITRE ATLAS
Kim, J., Liu, X., Wang, Z., Qiu, S., Li, B., Guo, W., & Song, D. (2026). The attack and defense landscape of agentic AI: A comprehensive survey [Preprint]. arXiv. arXiv:2603.11088
Tang, Y., Liu, Y., Lan, J., Yan, Z., & Gelenbe, E. (2026). Security of LLM-based agents regarding attacks, defenses, and applications: A comprehensive survey. Information Fusion, 127, Article 103941. https://doi.org/10.1016/j.inffus.2025.103941
Yao, S., Zhao, J., Yu, D., Du, N., Shafran, I., Narasimhan, K., & Cao, Y. (2023). ReAct: Synergizing reasoning and acting in language models. In The Eleventh International Conference on Learning Representations (ICLR 2023). arXiv:2210.03629
Shafranskyi, D., Stopochkina, I., & Ilin, M. (2026). Towards the development of an LLM-based methodology for automated security profiling in compliance with Ukrainian cybersecurity regulations. Theoretical and Applied Cybersecurity, 8(1), 100-111. https://doi.org/10.20535/tacs.2664-29132026.1.356631
Voitsekhovskyi, A., Stopochkina, I., Sun, P., Xie, J., Ilin, M., & Novikov, O. (2026). Detection of vulnerabilities in software for unmanned aerial vehicles by using large language models. Eastern-European Journal of Enterprise Technologies, 1(2 (139)), 36-47. https://doi.org/10.15587/1729-4061.2026.352029
Andreiev, D., Chornyi, A., Stopochkina, I., & Ilin, M. (2026). Methodology for automating cyber incident reports using LLM. Cybersecurity: Education, Science, Technique, 1(33), 274-285. https://doi.org/10.28925/2663-4023.2026.33.1156
Ferrag, M. A., Tihanyi, N., Hamouda, D., Maglaras, L., Lakas, A., & Debbah, M. (2026). From prompt injections to protocol exploits: Threats in LLM-powered AI agents workflows. ICT Express, 12(2), 353-383. https://doi.org/10.1016/j.icte.2025.12.001
NVIDIA. (n.d.). garak: The LLM vulnerability scanner [Computer software]. GitHub. Retrieved July 18, 2026, from NVIDIA garak
Microsoft. (n.d.). Python Risk Identification Tool for generative AI (PyRIT) [Computer software]. GitHub. Retrieved July 18, 2026, from Microsoft PyRIT
Bullwinkel, B., Minnich, A., Chawla, S., Lopez, G., Pouliot, M., Maxwell, W., de Gruyter, J., Pratt, K., Qi, S., Chikanov, N., Lutz, R., Dheekonda, R. S. R., Jagdagdorj, B.-E., Kim, E., Song, J., Hines, K., Jones, D., Severi, G., Lundeen, R., … Russinovich, M. (2025). Lessons from red teaming 100 generative AI products [Preprint]. arXiv. arXiv:2501.07238
Promptfoo. (n.d.). Promptfoo: LLM evals & red teaming [Computer software]. GitHub. Retrieved July 18, 2026, from Promptfoo GitHub repository
Wang, X., Chen, Y., Li, J., Wang, Y., Yao, Y., Gu, T., Li, J., Teng, Y., Ma, X., Wang, Y., & Hu, X. (2026). OpenRT: An open-source red teaming framework for multimodal LLMs [Preprint]. arXiv. arXiv:2601.01592
Mazeika, M., Phan, L., Yin, X., Zou, A., Wang, Z., Mu, N., Sakhaee, E., Li, N., Basart, S., Li, B., Forsyth, D., & Hendrycks, D. (2024). HarmBench: A standardized evaluation framework for automated red teaming and robust refusal. Proceedings of Machine Learning Research, 235, 35181-35224. arXiv:2402.04249
Chao, P., Debenedetti, E., Robey, A., Andriushchenko, M., Croce, F., Sehwag, V., Dobriban, E., Flammarion, N., Pappas, G. J., Tramèr, F., Hassani, H., & Wong, E. (2024). JailbreakBench: An open robustness benchmark for jailbreaking large language models. Advances in Neural Information Processing Systems, 37, 55005-55029. arXiv:2404.01318
Berenstein, D. (2025, December 16). Phare LLM benchmark V2: Reasoning models don’t guarantee better security. Giskard. Giskard
LangChain. (n.d.). LangChain documentation. Retrieved July 18, 2026, from LangChain documentation
Agent Security Evaluator [Computer software]. (n.d.). GitHub. Retrieved July 18, 2026, from Agent Security Evaluator repository
Опубліковано
Як цитувати
Номер
Розділ
Ліцензія
Авторське право (c) 2026 Ірина Стьопочкіна, Родислав Редько-Шпак

Ця робота ліцензується відповідно до Creative Commons Attribution-NonCommercial-ShareAlike 4.0 International License.