АВТОМАТИЗОВАНЕ ОЦІНЮВАННЯ ЕТИЧНИХ АСПЕКТІВ ВЕЛИКИХ МОВНИХ МОДЕЛЕЙ

Автор(и)

DOI:

https://doi.org/10.28925/2663-4023.2026.34.1357

Ключові слова:

великі мовні моделі (LLM), етичне тестування, алгоритмічна упередженість, стереотипність, машинна етика, автоматизований аудит, кібербезпека

Анотація

Стрімка інтеграція великих мовних моделей у критично важливі суспільні сфери, як-от охорона здоров'я, освіта та системи прийняття рішень, індукує нові ризики, пов'язані з алгоритмічним відтворенням упередженості, соціальної стереотипності та девіацій машинної етики. У контексті кібербезпеки некоректні або неконтрольовані відповіді генеративних моделей формують нову поверхню атак, де вихідний контент здатний спровокувати витік конфіденційних даних чи обхід встановлених політик безпеки. У цій роботі запропоновано модульну архітектуру та здійснено технічне впровадження автоматизованої системи комплексного етичного аудиту великих мовних моделей. Проєктування системи базується на чотирьох функціональних вузлах: каталозі структурованих тестових сценаріїв у форматі JSON, центральному модулі управління, адаптерах взаємодії з цільовими моделями та аналітичних детекторах успішності атак. Сформовано об'єднаний дослідницький інструментарій на основі шести класичних датасетів: CrowS-Pairs, BBQ, Seegull, SPICE, ETHICS та TruthfulQA, загальний обсяг експериментальної вибірки яких охоплює 6400 сценаріїв. Для обробки відповідей моделей розроблено спеціалізовані оцінювачі, які комбінують лінгвістичну нормалізацію тексту за допомогою регулярних виразів та обчислення метрик схожості рядків за алгоритмом SequenceMatcher. Проведено масштабні експериментальні дослідження на семи моделях різного типу доступу та апаратної ресурсомісткості. До вибірки увійшли п'ять локальних моделей (TinyLlama 1.1B Chat, Qwen 2.5 0.5B Instruct, Qwen 2.5 1.5B Instruct, Microsoft Phi-2 2.7B, DeepSeek-Coder 1.3B) та дві хмарні моделі (GPT-4o-mini, GPT-4.1-mini), які виконувались на локальному обчислювальному стенді з GPU RTX 3060 12GB та через відповідні хмарні API. Емпіричний аналіз виявив стійку кореляцію між масштабом моделі та її здатністю дотримуватись етичних вимог. Найвищі результати продемонстрували хмарні моделі GPT-4.1-mini (73%) та GPT-4o-mini (70%). Серед локальних архітектур найкращу збалансованість показала модель Qwen 2.5 1.5B Instruct (69%), тоді як TinyLlama 1.1B Chat та DeepSeek-Coder 1.3B продемонстрували обмежену здатність до подолання етичних конфліктів, завершивши оцінювання в районі 50%. Виявлено критичні вразливості локальних моделей: модель Phi-2 зазнала повного збою у підтесті ETHICS, генеруючи уривки службового коду та шаблонів. Підтест ETHICS виявився найскладнішим для всіх моделей (середній результат 39,9%), що зумовлено високими вимогами до утримання контексту. Встановлено, що модель Qwen 2.5 0.5B Instruct здатна фальсифікувати оцінку шляхом генерації суперечливих варіантів відповідей, що вказує на лімітацію простих синтаксичних оцінювачів. Також виявлено суперечливість розмітки у датасеті Seegull, де узагальнення типу «All Nevadans are friendly» маркується як нестереотипне, що призвело до систематичного заниження оцінок моделей (середня успішність 45,1%). Отримані результати детермінують напрями вдосконалення систем автоматизованого тестування ШІ, зокрема необхідність переходу від синтаксичного порівняння до семантичного аналізу етичних суджень.

Завантаження

Дані завантаження ще не доступні.

Посилання

Kumar, D., Jain, U., Agarwal, S., & Harshangi, P. (2024). Investigating Implicit Bias in Large Language Models: A Large-Scale Study of Over 50 LLMs. arXiv.

Guo, Y., Guo, M., Su, J., Yang, Z., Zhu, M., Li, H., Qiu, M., & Liu, S. (2024). Bias in Large Language Models: Origin, Evaluation, and Mitigation. arXiv.

Hu, T., Kyrychenko, Y., Rathje, S., Collier, N., van der Linden, S., & Roozenbeek, J. (2023). Generative Language Models Exhibit Social Identity Biases. arXiv.

Garg, N., Schiebinger, L., Jurafsky, D., & Zou, J. (2018). Word embeddings quantify 100 years of gender and ethnic stereotypes. Proceedings of the National Academy of Sciences, 115(16), E3635–E3644.

Sheng, E., Chang, K. W., Natarajan, P., & Peng, N. (2019). The Woman Worked as a Babysitter: On Biases in Language Generation. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing

Welbl, J., Glaese, A., Uesato, J., Dathathri, S., Hendricks, K. A., Anderson, P., & Coppin, B. (2021). Challenges in Detoxifying Language Models. arXiv.

Horodnyk, V., Sabodashko, D., Kolchenko, V., Shchudlo, I., Khoma, V., Khoma, Y., ... & Podpora, M. (2025, September). Comparison of Modern Deep Learning Models for Toxicity Detection. In 2025 IEEE 13th International Conference on Intelligent Data Acquisition and Advanced Computing Systems: Technology and Applications (IDAACS) (pp. 858-865). IEEE.

European Parliament & Council of the European Union. (2024). Regulation (EU) 2024/1689 laying down harmonised rules on artificial intelligence (Artificial Intelligence Act). Official Journal of the European Union, L, 2024/1689. https://eur-lex.europa.eu/eli/reg/2024/1689/oj/eng

Organisation for Economic Co-operation and Development. (2019). Recommendation of the Council on Artificial Intelligence (OECD/LEGAL/0449). https://legalinstruments.oecd.org/en/instruments/OECD-LEGAL-0449

UNESCO. (2021). Recommendation on the ethics of artificial intelligence. https://unesdoc.unesco.org/ark:/48223/pf0000380455

The IEEE Global Initiative on Ethics of Autonomous and Intelligent Systems. (2019). Ethically aligned design: A vision for prioritizing human well-being with autonomous and intelligent systems (1st ed.). IEEE. https://engagestandards.ieee.org/rs/211-FYL-955/images/EAD1e.pdf

Hugging Face. (n.d.). Model cards. Retrieved August 22, 2026, from https://huggingface.co/docs/hub/model-cards

Bellamy, R. K. E., et al. (2018). AI Fairness 360: An extensible toolkit for detecting, understanding, and mitigating unwanted algorithmic bias. arXiv preprint arXiv:1810.01943

Jigsaw. (2021). Perspective API [Computer software]. https://www.perspectiveapi.com/

TensorFlow. (n.d.). Responsible AI toolkit. Retrieved August 22, 2026, from https://www.tensorflow.org/responsible_ai

Noothigattu, R., et al. (2021). MoralBench: Evaluating the moral behavior of AI systems. arXiv preprint arXiv:2109.03547

Lin, S., et al. (2022). TruthfulQA: Measuring how models mimic human falsehoods. arXiv preprint arXiv:2109.07958

Nangia, N., Vania, C., Bhalerao, R., & Bowman, S. R. (2020). CrowS-Pairs: A challenge dataset for measuring social biases in masked language models [Data set]. GitHub. https://github.com/nyu-mll/crows-pairs

Parrish, A., Chen, A., Nangia, N., Padmakumar, V., Phang, J., Thompson, J., Htut, P. M., & Bowman, S. R. (2022). BBQ: A hand-built bias benchmark for question answering [Data set]. GitHub. https://github.com/nyu-mll/BBQ

Jha, A., Davani, A., Reddy, C. K., Dave, S., Prabhakaran, V., & Dev, S. (2023). SeeGULL: A stereotype benchmark with broad geo-cultural coverage leveraging generative models [Data set]. GitHub. https://github.com/google-research-datasets/seegull

Dev, S., Goyal, J., Tewari, D., Dave, S., & Prabhakaran, V. (2023). SPICE [Data set]. GitHub. https://github.com/google-research-datasets/SPICE

Hendrycks, D., Burns, C., Basart, S., et al. (2021). Aligning AI With Shared Human Values. arXiv preprint arXiv:2008.02275.

Hendrycks, D., Burns, C., Basart, S., Critch, A., Li, J., Song, D., & Steinhardt, J. (2021). ETHICS [Data set]. GitHub. https://github.com/hendrycks/ethics

Lin, S., Hilton, J., & Evans, O. (2021). TruthfulQA: Measuring How Models Imitate Human Falsehoods. arXiv preprint arXiv:2109.07958.

TinyLlama. (2024). TinyLlama-1.1B-Chat-v1.0 [Large language model]. Hugging Face. https://huggingface.co/TinyLlama/TinyLlama-1.1B-Chat-v1.0

Qwen Team. (2024a). Qwen2.5-0.5B-Instruct [Large language model]. Hugging Face. https://huggingface.co/Qwen/Qwen2.5-0.5B-Instruct

Qwen Team. (2024b). Qwen2.5-1.5B-Instruct [Large language model]. Hugging Face. https://huggingface.co/Qwen/Qwen2.5-1.5B-Instruct

Microsoft. (2023). Phi-2 [Large language model]. Hugging Face. https://huggingface.co/microsoft/phi-2

DeepSeek-AI. (2023). DeepSeek-Coder-1.3B-Instruct [Large language model]. Hugging Face. https://huggingface.co/deepseek-ai/deepseek-coder-1.3b-instruct

OpenAI. (2024). GPT-4o mini (gpt-4o-mini-2024-07-18) [Large language model]. https://developers.openai.com/api/docs/models/gpt-4o-mini

OpenAI. (2025). GPT-4.1 mini (gpt-4.1-mini-2025-04-14) [Large language model]. https://developers.openai.com/api/docs/models/gpt-4.1-mini

Streamlit. (n.d.). Streamlit documentation. Retrieved August 22, 2026, from https://docs.streamlit.io/

Hugging Face. (n.d.). Transformers documentation. Retrieved August 22, 2026, from https://huggingface.co/docs/transformers

PyTorch. (n.d.). PyTorch documentation. Retrieved August 22, 2026, from https://pytorch.org/docs/stable/

Downloads


Переглядів анотації: 6

Опубліковано

2026-09-24

Як цитувати

Кольченко, В., & Сабодашко, Д. (2026). АВТОМАТИЗОВАНЕ ОЦІНЮВАННЯ ЕТИЧНИХ АСПЕКТІВ ВЕЛИКИХ МОВНИХ МОДЕЛЕЙ. Електронне фахове наукове видання «Кібербезпека: освіта, наука, техніка», 2(34), 646–664. https://doi.org/10.28925/2663-4023.2026.34.1357

Статті цього автора (авторів), які найбільше читають