АВТОМАТИЗОВАНЕ ОЦІНЮВАННЯ ЕТИЧНИХ АСПЕКТІВ ВЕЛИКИХ МОВНИХ МОДЕЛЕЙ
DOI:
https://doi.org/10.28925/2663-4023.2026.34.1357Ключові слова:
великі мовні моделі (LLM), етичне тестування, алгоритмічна упередженість, стереотипність, машинна етика, автоматизований аудит, кібербезпекаАнотація
Стрімка інтеграція великих мовних моделей у критично важливі суспільні сфери, як-от охорона здоров'я, освіта та системи прийняття рішень, індукує нові ризики, пов'язані з алгоритмічним відтворенням упередженості, соціальної стереотипності та девіацій машинної етики. У контексті кібербезпеки некоректні або неконтрольовані відповіді генеративних моделей формують нову поверхню атак, де вихідний контент здатний спровокувати витік конфіденційних даних чи обхід встановлених політик безпеки. У цій роботі запропоновано модульну архітектуру та здійснено технічне впровадження автоматизованої системи комплексного етичного аудиту великих мовних моделей. Проєктування системи базується на чотирьох функціональних вузлах: каталозі структурованих тестових сценаріїв у форматі JSON, центральному модулі управління, адаптерах взаємодії з цільовими моделями та аналітичних детекторах успішності атак. Сформовано об'єднаний дослідницький інструментарій на основі шести класичних датасетів: CrowS-Pairs, BBQ, Seegull, SPICE, ETHICS та TruthfulQA, загальний обсяг експериментальної вибірки яких охоплює 6400 сценаріїв. Для обробки відповідей моделей розроблено спеціалізовані оцінювачі, які комбінують лінгвістичну нормалізацію тексту за допомогою регулярних виразів та обчислення метрик схожості рядків за алгоритмом SequenceMatcher. Проведено масштабні експериментальні дослідження на семи моделях різного типу доступу та апаратної ресурсомісткості. До вибірки увійшли п'ять локальних моделей (TinyLlama 1.1B Chat, Qwen 2.5 0.5B Instruct, Qwen 2.5 1.5B Instruct, Microsoft Phi-2 2.7B, DeepSeek-Coder 1.3B) та дві хмарні моделі (GPT-4o-mini, GPT-4.1-mini), які виконувались на локальному обчислювальному стенді з GPU RTX 3060 12GB та через відповідні хмарні API. Емпіричний аналіз виявив стійку кореляцію між масштабом моделі та її здатністю дотримуватись етичних вимог. Найвищі результати продемонстрували хмарні моделі GPT-4.1-mini (73%) та GPT-4o-mini (70%). Серед локальних архітектур найкращу збалансованість показала модель Qwen 2.5 1.5B Instruct (69%), тоді як TinyLlama 1.1B Chat та DeepSeek-Coder 1.3B продемонстрували обмежену здатність до подолання етичних конфліктів, завершивши оцінювання в районі 50%. Виявлено критичні вразливості локальних моделей: модель Phi-2 зазнала повного збою у підтесті ETHICS, генеруючи уривки службового коду та шаблонів. Підтест ETHICS виявився найскладнішим для всіх моделей (середній результат 39,9%), що зумовлено високими вимогами до утримання контексту. Встановлено, що модель Qwen 2.5 0.5B Instruct здатна фальсифікувати оцінку шляхом генерації суперечливих варіантів відповідей, що вказує на лімітацію простих синтаксичних оцінювачів. Також виявлено суперечливість розмітки у датасеті Seegull, де узагальнення типу «All Nevadans are friendly» маркується як нестереотипне, що призвело до систематичного заниження оцінок моделей (середня успішність 45,1%). Отримані результати детермінують напрями вдосконалення систем автоматизованого тестування ШІ, зокрема необхідність переходу від синтаксичного порівняння до семантичного аналізу етичних суджень.
Завантаження
Посилання
Kumar, D., Jain, U., Agarwal, S., & Harshangi, P. (2024). Investigating Implicit Bias in Large Language Models: A Large-Scale Study of Over 50 LLMs. arXiv.
Guo, Y., Guo, M., Su, J., Yang, Z., Zhu, M., Li, H., Qiu, M., & Liu, S. (2024). Bias in Large Language Models: Origin, Evaluation, and Mitigation. arXiv.
Hu, T., Kyrychenko, Y., Rathje, S., Collier, N., van der Linden, S., & Roozenbeek, J. (2023). Generative Language Models Exhibit Social Identity Biases. arXiv.
Garg, N., Schiebinger, L., Jurafsky, D., & Zou, J. (2018). Word embeddings quantify 100 years of gender and ethnic stereotypes. Proceedings of the National Academy of Sciences, 115(16), E3635–E3644.
Sheng, E., Chang, K. W., Natarajan, P., & Peng, N. (2019). The Woman Worked as a Babysitter: On Biases in Language Generation. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing
Welbl, J., Glaese, A., Uesato, J., Dathathri, S., Hendricks, K. A., Anderson, P., & Coppin, B. (2021). Challenges in Detoxifying Language Models. arXiv.
Horodnyk, V., Sabodashko, D., Kolchenko, V., Shchudlo, I., Khoma, V., Khoma, Y., ... & Podpora, M. (2025, September). Comparison of Modern Deep Learning Models for Toxicity Detection. In 2025 IEEE 13th International Conference on Intelligent Data Acquisition and Advanced Computing Systems: Technology and Applications (IDAACS) (pp. 858-865). IEEE.
European Parliament & Council of the European Union. (2024). Regulation (EU) 2024/1689 laying down harmonised rules on artificial intelligence (Artificial Intelligence Act). Official Journal of the European Union, L, 2024/1689. https://eur-lex.europa.eu/eli/reg/2024/1689/oj/eng
Organisation for Economic Co-operation and Development. (2019). Recommendation of the Council on Artificial Intelligence (OECD/LEGAL/0449). https://legalinstruments.oecd.org/en/instruments/OECD-LEGAL-0449
UNESCO. (2021). Recommendation on the ethics of artificial intelligence. https://unesdoc.unesco.org/ark:/48223/pf0000380455
The IEEE Global Initiative on Ethics of Autonomous and Intelligent Systems. (2019). Ethically aligned design: A vision for prioritizing human well-being with autonomous and intelligent systems (1st ed.). IEEE. https://engagestandards.ieee.org/rs/211-FYL-955/images/EAD1e.pdf
Hugging Face. (n.d.). Model cards. Retrieved August 22, 2026, from https://huggingface.co/docs/hub/model-cards
Bellamy, R. K. E., et al. (2018). AI Fairness 360: An extensible toolkit for detecting, understanding, and mitigating unwanted algorithmic bias. arXiv preprint arXiv:1810.01943
Jigsaw. (2021). Perspective API [Computer software]. https://www.perspectiveapi.com/
TensorFlow. (n.d.). Responsible AI toolkit. Retrieved August 22, 2026, from https://www.tensorflow.org/responsible_ai
Noothigattu, R., et al. (2021). MoralBench: Evaluating the moral behavior of AI systems. arXiv preprint arXiv:2109.03547
Lin, S., et al. (2022). TruthfulQA: Measuring how models mimic human falsehoods. arXiv preprint arXiv:2109.07958
Nangia, N., Vania, C., Bhalerao, R., & Bowman, S. R. (2020). CrowS-Pairs: A challenge dataset for measuring social biases in masked language models [Data set]. GitHub. https://github.com/nyu-mll/crows-pairs
Parrish, A., Chen, A., Nangia, N., Padmakumar, V., Phang, J., Thompson, J., Htut, P. M., & Bowman, S. R. (2022). BBQ: A hand-built bias benchmark for question answering [Data set]. GitHub. https://github.com/nyu-mll/BBQ
Jha, A., Davani, A., Reddy, C. K., Dave, S., Prabhakaran, V., & Dev, S. (2023). SeeGULL: A stereotype benchmark with broad geo-cultural coverage leveraging generative models [Data set]. GitHub. https://github.com/google-research-datasets/seegull
Dev, S., Goyal, J., Tewari, D., Dave, S., & Prabhakaran, V. (2023). SPICE [Data set]. GitHub. https://github.com/google-research-datasets/SPICE
Hendrycks, D., Burns, C., Basart, S., et al. (2021). Aligning AI With Shared Human Values. arXiv preprint arXiv:2008.02275.
Hendrycks, D., Burns, C., Basart, S., Critch, A., Li, J., Song, D., & Steinhardt, J. (2021). ETHICS [Data set]. GitHub. https://github.com/hendrycks/ethics
Lin, S., Hilton, J., & Evans, O. (2021). TruthfulQA: Measuring How Models Imitate Human Falsehoods. arXiv preprint arXiv:2109.07958.
TinyLlama. (2024). TinyLlama-1.1B-Chat-v1.0 [Large language model]. Hugging Face. https://huggingface.co/TinyLlama/TinyLlama-1.1B-Chat-v1.0
Qwen Team. (2024a). Qwen2.5-0.5B-Instruct [Large language model]. Hugging Face. https://huggingface.co/Qwen/Qwen2.5-0.5B-Instruct
Qwen Team. (2024b). Qwen2.5-1.5B-Instruct [Large language model]. Hugging Face. https://huggingface.co/Qwen/Qwen2.5-1.5B-Instruct
Microsoft. (2023). Phi-2 [Large language model]. Hugging Face. https://huggingface.co/microsoft/phi-2
DeepSeek-AI. (2023). DeepSeek-Coder-1.3B-Instruct [Large language model]. Hugging Face. https://huggingface.co/deepseek-ai/deepseek-coder-1.3b-instruct
OpenAI. (2024). GPT-4o mini (gpt-4o-mini-2024-07-18) [Large language model]. https://developers.openai.com/api/docs/models/gpt-4o-mini
OpenAI. (2025). GPT-4.1 mini (gpt-4.1-mini-2025-04-14) [Large language model]. https://developers.openai.com/api/docs/models/gpt-4.1-mini
Streamlit. (n.d.). Streamlit documentation. Retrieved August 22, 2026, from https://docs.streamlit.io/
Hugging Face. (n.d.). Transformers documentation. Retrieved August 22, 2026, from https://huggingface.co/docs/transformers
PyTorch. (n.d.). PyTorch documentation. Retrieved August 22, 2026, from https://pytorch.org/docs/stable/
Опубліковано
Як цитувати
Номер
Розділ
Ліцензія
Авторське право (c) 2026 Віктор Кольченко, Дмитро Сабодашко

Ця робота ліцензується відповідно до Creative Commons Attribution-NonCommercial-ShareAlike 4.0 International License.