До питання оцінки надійності кластерних обчислювальних систем
DOI:
https://doi.org/10.34121/1028-9763-2026-1-100-108Ключові слова:
кластер, надійність, обчислювальні інформаційні системи, хаос тестування, балансування навантаження, DN-розподіл відмовАнотація
Стаття присвячена дослідженню міжнародних підходів до оцінювання надійності кластерних обчислювальних систем та поєднання з сучасними вітчизняними методологіями. Кластерні системи широко застосовуються у фундаментальних та прикладних дослідженнях, чисельному моделюванні складних фізичних процесів, кліматичному прогнозуванні, аналізі великих обсягів даних, у аерокосмічній та автомобільній галузях, енергетиці, хмарних обчисленнях та інших сферах. Тому оцінка надійності кластерних обчислювальних систем є критично важливою для забезпечення їх безперервного функціонування та стійкості до збоїв в умовах інтенсивного навантаження. Комплексна оцінка надійності кластерних систем складається з таких етапів: аналіз компонентів структури системи; обчислення метрик надійності; моделювання сценаріїв відмов; аналіз імовірностей комбінованих збоїв; оцінка резервування. Встановлено, що в цілому кластерні системи мають так звану «k» із «n» структуру, тому метрики надійності розраховують згідно з відповідними вітчизняними методологіями. У загальному випадку відмови кластерних обчислювальних систем мають немонотонний характер. Тому для розрахунку, наприклад, імовірності безвідмовної роботи можна застосувати сучасні вітчизняні методології, засновані на DN-розподілі відмов. Оцінка надійності кластерних обчислювальних систем являє собою багаторівневий підхід, що поєднує аналітичні, експериментальні та модельні методи дослідження. Такий комплексний підхід дозволяє виявити потенційні вузькі місця в архітектурі системи, визначити критичні компоненти та оцінити ризики збоїв. Це дає змогу своєчасно впроваджувати ефективні механізми відмовостійкості, резервування та автоматичного відновлення.
Посилання
1. Barney В., Frederick D. HPC @ LLNL: Introduction to Parallel Computing Tutorial. URL: https://hpc.llnl.gov/documentation/tutorials/introduction-parallel-computing-tutorial?utm_source=chatgpt.com.
2. Beowulf (кластер). URL: https://ru.wikipedia.org/wiki/Beowulf_(%D0%BA%D0%BB%D0%B0%D1%81%D1%82%D0%B5%D1%80).
3. HPC @ LLNL: Introduction to Parallel Computing Tutorial. URL: https://hpc.llnl.gov/documentation/tutorials/introduction-parallel-computing-tutorial.
4. CelerData: How Parallel Processing Shaped Modern Computing. URL: https://celerdata.com/glossary/how-parallel-processing-shaped-modern-computing?utm_source=chatgpt.com.
5. Learn: Distributed GPU training guide (SDK v2). URL: https://learn.microsoft.com/enus/azure/machine-learning/how-to-train-distributed-gpu?view=azureml-api2&utm_source=chatgpt.com.
6. Стрельников В.П., Федухин А.В. Оценка и прогнозирование надежности электронных элементов и систем. К.: Логос, 2002. 486 с.
7. ДСТУ 2862-94. Надійність техніки. Методи розрахунку показників надійності. Загальні вимоги. К.: Видавництво Держстандарту України, 1995. 40 с.
8. Embracing the Chaos: Using Fault Injection Testing to Build Resilient AWS Architectures. URL: https://vitiya99.medium.com/embracing-the-chaos-using-fault-injection-testing-to-build-resilient-awsarchitectures-ff25e77e6830.
9. Lamport L. My TLA+ Home Page. URL: https://lamport.azurewebsites.net/tla/tla.html.
10. HBK: Fault Tree Analysis, Reliability Block Diagrams and BlockSim. URL: https://www.hbkworld.com/en/knowledge/resource-center/articles/fault-tree-analysis-reliability-blockdiagrams-and-blocksim?utm_source=chatgpt.com.
Опубліковано
Номер
Розділ
Ліцензія

Ця робота ліцензується відповідно до ліцензії Creative Commons Attribution 4.0 International License.
