![]()
| AI Factory 시대에 데이터센터 냉방을 AI로 자율제어하려는 시도가 확산되고 있지만, 정작 고객 서비스가 가동 중인 상용 전산실에서 안전 기준을 지키며 자율제어를 실현하는 단계에서는 여전히 많은 시행착오를 겪고 있습니다. 기술력이 아니라 '어떤 인프라에서 어떻게 데이터를 모을 수 있는가'라는 데이터 확보 조건의 차이 때문입니다. 이 글에서는 데이터센터 냉방 AI 자율제어가 그동안 어떻게 발전해왔는지 살펴보고, 고객 서비스가 운영 중인 상용 전산실에 특화된 LG CNS의 냉방 AI 자율제어 개발 전략과 실증 성과, 그리고 앞으로 확장되는 방향까지 짚어보겠습니다. |
게임을 오래 하거나 무거운 프로그램을 돌리다 보면, 어느 순간 PC 팬이 '웅—' 하고 요란하게 돌기 시작합니다. 본체 뒤에 손을 대 보면 더운 바람이 훅 뿜어져 나오죠. 시끄럽고 뜨겁긴 해도, 사실은 냉각팬이 부지런히 돌며 PC가 느려지지 않게 버텨 주고 있다는 뜻입니다.
이 장면을 데이터센터 규모로 키워 보겠습니다. AI 데이터센터에는 수많은 고성능 서버가 빽빽하게 들어차 쉬지 않고 돌아갑니다. PC 한 대에서도 신경 쓰이던 냉각이 여기서는 서버의 성능과 무중단 운영을 좌우하는 설비 운영 문제가 됩니다. 전 세계 데이터센터의 전력 소비를 살펴보면 서버뿐 아니라 냉각에 쓰이는 에너지가 절반에 가깝습니다.1)
2016년, 구글은 AI를 적용해 데이터센터 냉방에 쓰이는 에너지를 40% 줄였다고 발표했습니다. 오랫동안 설비 엔지니어의 경험과 보수적인 운전 규칙이 지켜 온 영역에서, 학습 기반 AI의 가능성을 선명한 숫자로 보여 준 대표적인 선례였습니다.
그 뒤 10년 동안 AI 모델의 규모는 폭발적으로 커졌고, 이를 학습하고 구동하는 데 필요한 고성능 서버도 크게 늘면서 데이터센터가 내뿜는 열도 가파르게 증가했습니다. 하지만 냉방 운전 기술은 그 속도를 따라가지 못했습니다. 현장에서는 여전히 전문가의 경험을 바탕으로 설정한 보수적인 운전 방식에 크게 의존하고 있습니다.
운영자는 최대 부하와 예상하지 못한 상황에서도 서버를 지킬 수 있도록 필요한 수준보다 안전 마진을 두어 서버를 훨씬 더 차갑게 유지해 왔습니다. 판단이 한 번 어긋나면 고객 서비스까지 멈출 수 있어, 실패의 대가가 큰 설비에서 이는 합리적인 선택입니다. 다만 이 과정에서 전력이 비효율적으로 소모되고 있습니다.
LG CNS도 하남 데이터센터에서 이 난제에 도전했습니다. 그 과정에서 선행 사례가 이미 드러낸 한계와 새로운 문제들을 차례로 만났습니다. 이 글은 LG CNS가 어떤 문제를 어떻게 풀어 실제 데이터센터에서 검증했는지에 대한 기록입니다.

[그림 1] 실환경 적용과 방법론을 함께 공개한 사례의 흐름
이 문제를 가장 먼저 공개적으로 다룬 곳은 구글입니다. 2016년, 구글은 냉방 에너지를 줄이기 위해 데이터센터의 냉방 효율을 계산하는 신경망 모델을 학습시켰습니다. 자사 데이터센터 실제 현장의 수천 개 설비 센서 기록을 데이터로 모델을 학습시킨 결과, 냉방 에너지를 최대 40% 줄였다고 발표했습니다. 다만 이때는 AI가 직접 데이터센터를 제어하는 것이 아닌 사람이 검토 및 제어를 해야 하는 ‘반자율제어 추천 시스템’에 가까운 구조였습니다.2)
2018년에는 제어에서 사람을 제외하는 첫 시도를 합니다. 5분마다 AI가 설비를 직접 제어하도록 하면서, 그 과정에서 문제가 발생하지 않도록 여덟 가지 안전장치를 함께 걸었습니다. 구글이 밝힌 바에 따르면, 이는 운영 중인 데이터센터에서 AI가 냉방 설비를 직접 움직인 첫 사례입니다.3)
같은 해 공개된 별도의 구글 현장 연구에서는 데이터센터에서 전문가의 경험을 바탕으로 설비를 제어한 비례·적분·미분 제어(Proportional–Integral–Derivative, PID) 로그에는 모델 학습에 충분한 정보가 포함되지 않는다는 점을 지적했습니다. 이를 해결하기 위해 안전을 유지할 수 있는 범위 내에서 운영 중인 설비를 무작위로 조작하여 실험 데이터를 수집했습니다. 수집한 데이터로 30초 뒤의 데이터센터의 환경을 예측하는 선형 모델을 학습시켜 모델 예측 제어(Model Predictive Control, MPC)에 연결하여 제어했습니다. 그 결과, AI가 공조기 팬 속도와 밸브 개도를 30초 주기로 자율제어하는 데 성공했습니다.4)
6년 뒤 메타는 완전히 다른 길을 택했습니다. 운영 설비에서 직접 데이터를 수집하면 설비를 위험에 노출시킬 수 있고 실험 비용도 큽니다. 그래서 실물 대신 열역학과 건물 에너지 특성을 반영한 물리 기반 가상 시뮬레이터(Computational Fluid Dynamics, CFD)를 만들었습니다. 시뮬레이터 안에서는 어떤 조작이든 할 수 있고 이는 운영 중인 설비에 어떠한 위험도 주지 않습니다. 또한 메타가 개발한 시뮬레이터는 서버 앞쪽 찬 공기 구역의 온도를 평균 절대 오차 1°F(약 0.6°C) 이내로 재현할 정도의 성능을 보였습니다. 시뮬레이터 안에서 강화학습으로 급기 풍량 제어 정책을 학습시켰고, 2021년 한 구역에서 시작한 파일럿 결과를 2024년에 공개했습니다. 메타가 보고한 절감 효과는 급기팬 에너지 20%, 물 사용 4%였습니다.5)
가상 시뮬레이터는 안전하고 유용한 방식이어서 누구나 실물 대신 사용하고 싶겠지만 여기엔 한 가지 함정이 있습니다. 시뮬레이터 구축이 선행되어야 하고, 무엇보다 실제와 거의 동일한 수준이어야 합니다.
데이터센터 냉각은 구글과 메타도 수년에 걸쳐 풀어 온 난제입니다. 단순히 에너지만 적게 쓰면 끝나는 일이 아니라 ① 실시간으로 달라지는 서버 부하와 계절 변화라는 큰 변수에 대응할 수 있어야 합니다. ② 동시에 설비 안전을 지켜야 하고 ③ 필요 시 운영자가 언제든 즉시 개입하고 통제할 수 있는 장치가 필요합니다. 이 세 조건을 동시에 만족하면서 실제 현장에 적용된 사례는 극히 드뭅니다.
여기에 실환경 성과뿐 아니라 적용 방법과 안전 확보 방식까지 모두 공개한 사례는 공개 자료 기준으로 확인한 범위에서는 구글과 메타, 이 두 경쟁사뿐이었습니다.
LG CNS도 이 난제에 도전하기로 했습니다. LG CNS가 실제 운영 중인 데이터센터에서 AI 자율제어에 성공하기까지 맞닥뜨린 문제와, 그 해결을 위해 무엇을 달리 설계했는지 이어서 살펴보겠습니다.
[열 전달의 경로] 급기 → 서버 → 환기 → 다시 급기
냉방 제어는 결국 전산실 안에서 공기가 어떻게 도는지를 이해하는 데서 시작합니다. 아래 그림에서 파란 화살표를 따라가 보겠습니다.

[그림 2] 전산실 1개 구역의 냉각 공기 흐름 — 쿨존·핫존과 FWU 배치
팬월 유닛(Fan Wall Unit, FWU)은 전산실 벽면에 붙어 있는 냉방 장치입니다. 내부의 열교환기(Heat Exchanger)를 지나며 차가워진 공기가 팬을 통해 서버 랙 앞쪽 통로(그림의 “Cool-air supply aisle”, 이하 쿨존)로 뿜어져 나옵니다. 이 흐름이 급기입니다. 이 공기가 서버를 통과하며 서버가 내뿜는 열을 흡수하고, 데워진 공기는 랙 뒤편 통로(“Enclosed hot-air return duct”, 이하 핫존)에 모여 다시 FWU로 빨려 들어갑니다. 그림의 빨간 화살표가 바로 이 되돌아오는 흐름, 환기 경로입니다.
전산실에서는 이 흐름이 순환을 이루며 열과 공기가 이동하고 있습니다. 이를 통해 고객의 서비스가 운영되고 있는 서버 설비를 항상 차갑게 유지할 수 있습니다. 앞서 데이터센터 전력 소비의 절반은 냉각에 쓰인다고 했습니다. 그중 많은 부분을 차지하고 있는 것이 바로 이 FWU가 소모하는 전력입니다. FWU의 회전수와 출력을 높일수록 더 많은 전력이 필요하고 반대로 출력을 낮출수록 전력을 절약할 수 있습니다. 제어하여 전력을 줄이는 방법이 바로 전산실에 있는 FWU 32대의 출력을 낮추는 것입니다.
다만 출력을 낮추기만 할 수는 없습니다. 출력을 낮추면 그만큼 전산실이 뜨거워지고 공기의 흐름이 정체되면서 운영 중인 설비가 위험에 빠질 수 있습니다.
데이터센터의 안전을 지키기 위해선 두 가지 기준을 반드시 지켜야 합니다. 하나는 서버 랙 앞쪽, 즉 쿨존에서 서버로 빨려 들어가는 공기의 온도이고, 다른 하나는 쿨존과 핫존 사이의 압력 차이(차압)입니다. 쿨존의 온도가 너무 높으면 서버를 차갑게 할 수 없고, 차압이 역전되면 핫존의 뜨거운 공기가 쿨존으로 역류해 서버 온도가 순식간에 치솟을 수 있기 때문입니다. 이 기준들은 서비스 수준 협약(Service Level Agreement, SLA)으로 데이터센터 운영 시에 반드시 지켜야 하는 고객과의 약속입니다.

[그림 3] 부하가 오르내리는 동안 냉방은 고정된 채로 — 그 차이가 과냉각이다
기준을 지키기 위해서 운영자는 제어값을 설정할 때 안전 마진을 두어 여유를 마련합니다. 비효율적으로 보일 수 있지만, 순간적으로 서버의 사용량이 폭증하거나 갑작스럽게 설비에 서버가 추가될 수도 있기 때문에 이는 예상하지 못한 일이 발생했을 때 서버를 지키기 위한 합리적인 선택입니다.
그런데 문제는 전산실 발열이 하루 내내 일정하지 않다는 데 있습니다. 그림의 파란 점선은 서버를 이용하면서 발생하는 실제 부하량입니다. 시간에 따라 서버를 사용하는 사람이 많아지면서 서버가 내뿜는 발열량이 늘어나고, 자연스럽게 이를 해결하기 위해 필요한 냉방량(파란 실선)도 달라집니다.
운영자는 부하가 가장 높은 일일 서버 부하 최대점(그림의 빨간 점)을 기준으로 안전 마진까지 더한 값을 운전 설정값으로 고정합니다. 그리고 하루 종일 그 값(빨간 점선)으로 설비를 운영합니다. 그 결과, 저부하 시간(그림의 파란 점)에는 자연스럽게 에너지 낭비가 발생합니다. 고정 운전선(빨간 점선)과 실제 필요한 냉방량(파란 실선) 사이의 이 간격이 과냉각이자 회수되지 않고 낭비되는 여유입니다.
AI로 에너지 낭비를 줄이려면 팬 출력을 바꿨을 때 온도와 차압이 어떻게 변하는지 미리 예측할 수 있어야 합니다. 예측 없이 팬을 조절하면 안전 기준을 벗어날 위험이 있기 때문입니다. LG CNS는 예측 모델을 학습시켜 팬 출력에 따른 전산실의 열 이동을 알아보고자 했고, 모델을 학습시키기 위한 데이터가 필요했습니다. 이와 관련한 경쟁사 방식의 한계, 그리고 이를 해결하기 위한 LG CNS의 해결 방법을 소개합니다.
구글과 메타는 AI로 설비를 자율제어하는 데에는 성공했으나 널리 확산되지는 못했습니다. 이유는 아래와 같습니다.
| 구글 | 메타 | |
| 접근 | 운영 중인 설비를 조작하여 실험 데이터를 만들고, 그 데이터로 학습한 예측 모델을 모델 예측 제어에 연결해 최적 제어 수행 | 물리 기반 열 시뮬레이터를 먼저 만들고, 그 안에서 강화학습으로 급기 풍량 정책을 학습 |
| 효과 | 2016년 반자율제어, 냉방 에너지 최대 40% 절감 | 2018년 자율제어 약 30% 절감 급기팬 에너지 20%, 물 사용 4% 절감 |
| 한계 | 자사 인프라를 사용한 실험 데이터 수집 | 시뮬레이션 구축·검증 비용이 크다 |
[표 1] 구글과 메타의 접근 · 효과 · 한계
구글은 운영 중인 서버 설비를 조작하여 선형 모델을 위한 소규모 학습 데이터를 직접 만들었습니다. 이 방법이 가능했던 것은 자사 인프라에서 실험을 수행할 수 있어 실험 범위와 SLA 조건을 스스로 결정할 수 있었기 때문입니다. 일반적인 데이터센터 서버 설비에는 자사가 아닌 고객의 서비스가 올라가 있기 때문에 SLA의 주체는 고객입니다. 고객의 서비스가 올라가 있는 설비를 예측하지 못한 환경에 노출시킬 수도 있는 조건에서는 무작위로 데이터를 수집할 수 없습니다.
메타는 실제 설비를 조작하여 반복적으로 데이터를 수집하는 대신, 전산실을 고신뢰도 시뮬레이터로 구현해 그 안에서 냉방 공조 동작과 열 분포를 예측하여 데이터를 수집하고 모델을 학습하는 방식을 사용했습니다. 이 방식이 작동하려면 시뮬레이터에 실제 전산실을 매우 정교하게 옮겨 구현해야 하는데, 이는 매우 어렵고 비용도 많이 듭니다.

[그림 4] 실제 전산실과 CFD 시뮬레이터 간 국소 편차(개념 예시)
그림 4는 실제 전산실과 CFD(Computational Fluid Dynamics) 시뮬레이션 결과를 개념적으로 표현한 그림입니다. 그림의 왼쪽은 실제 전산실로 서버 랙, 냉각기, 배관, 케이블 트레이, 이중마루와 급기구처럼 열과 공기 흐름에 영향을 주는 설비가 복잡하게 얽혀 있습니다. 오른쪽은 이 공간을 CFD 시뮬레이션으로 옮긴 결과인데, 복잡한 설비가 열과 공기 흐름에 준 영향을 그대로 모델링하는 것은 쉬운 일이 아닙니다. 먼저 실제 설비의 형상과 위치를 모델링해야 하고, 계산 격자를 생성한 뒤에 냉기 유입량·팬 풍량·온도 설정값 같은 경계조건을 현장 조건에 맞춰 조정해야 합니다. 이후에도 시뮬레이션 결과가 실측 데이터와 일치하는지 검증해야 하고 일치하지 않는다면 다시 이 과정을 반복해야 합니다.6) 이는 구축 및 검증에 막대한 시간적·물적 비용이 든다는 뜻입니다.
문제는 이렇게 많은 비용을 들여 시뮬레이터를 구축해도, 실제 설비와는 차이가 있다는 점입니다. 그림 4의 빨간 점선 영역은 이를 보여 주는 개념 예시입니다. 실제 설비에서는 국소 최고 온도가 32.1°C까지 높아졌지만, 시뮬레이터는 같은 위치를 25.4°C로 예측해 6.7°C의 편차가 발생합니다. 전체적인 온도 분포는 유사해 보여도, 실제 운전과 안전 판단에 중요한 국소 고온부를 놓치게 되면 AI가 잘못된 판단을 할 수 있습니다. 이러한 시뮬레이션-현실 간 격차(Sim-to-Real gap)는 현장에 적용한 뒤에야 관찰할 수 있고, 서비스가 운영 중인 설비에서는 그 검증 자체가 부담이 됩니다. 더욱이 시뮬레이션을 개발하던 중에 서버나 설비의 보수나 증설로 랙 배치, 배관, 냉각 설비가 바뀌면 모델과 경계조건을 다시 맞춰야 합니다.
LG CNS는 고객의 서비스가 올라간 설비를 안전하게 조정해야 했고, 시뮬레이터를 세울 일정도 실험을 거듭할 예산도 없었습니다. 우리는 우리만의 방식으로 문제를 해결해야 했습니다. 이 지점에서 과제는 두 갈래로 정리됐습니다. 학습에 필요한 데이터를 안전하게 만드는 일, 그리고 그 데이터로 배운 모델을 실제 제어에 연결하는 일입니다.
팬 출력을 바꿨을 때 온도와 차압이 어떻게 반응하는지 예측하려면, 다양한 운전 조건의 데이터를 수집하여 예측 모델을 학습해야 합니다. 하지만 기존 PID 제어로 쌓인 운영 기록에는 이러한 정보가 충분하지 않았습니다. 그림 5의 상단은 설정된 목표 온도와 현재 온도의 차이를 줄이는 PID 제어 과정을 보여 줍니다. 그 결과, 그림 하단처럼 실내 온도는 24°C 부근에(왼쪽 그래프), 팬 출력은 좁은 범위에(오른쪽 그래프) 집중됩니다.
[그림 5] 목표 온도에 맞추는 PID 제어로 인해 과거 팬 출력 데이터는 설정값 주변 운영 구간에 몰려 있다.
PID 제어 데이터는 안정적인 운영 상태를 보여 주지만, 팬 출력을 지금보다 낮췄을 때도 안전 기준을 지킬 수 있는지 모델이 학습하기에는 부족했습니다. 비슷한 조건의 데이터가 아무리 많이 쌓여도, 모델은 자율제어가 찾아가야 할 저출력 운전 영역에서 무슨 일이 일어나는지 알 수 없기 때문입니다. 그래서 다양한 조건으로 팬 출력을 조정하면서 냉방 설비의 상태와 온도 변화 등의 추가 데이터를 수집했습니다.
처음에는 운영 전문가가 직접 팬 출력을 조정하고, 온도가 안정된 뒤 환경값을 기록했습니다. 하지만 사람이 계속 모니터링해야 하기 때문에 시간과 인력의 제약이 매우 컸습니다. 이후에는 안전 기준 안에서 자동으로 실험이 가능한 통계 기반 수집 방식을 다양하게 적용했습니다. 이를 통해 사람의 개입을 줄이고 더 넓은 운전 조건의 데이터를 확보할 수 있었습니다. 그 결과를 개념적으로 표현한 것이 그림 6입니다.

[그림 6] 다양한 운전 조건에서 데이터를 모았지만, 최적 운전 영역을 학습할 데이터는 충분하지 않았다.
그림 6의 파란 점 하나는 실험으로 수집한 운전 데이터 한 건을 뜻합니다. 오른쪽 위의 파란 점선은 기존 PID 운전 영역이고, 왼쪽 아래의 빨간 점선은 안전 기준을 지키면서 팬 출력을 낮추려는 최적 운전 영역입니다. 고르게 흩어진 점들처럼 추가 실험은 기존 운전 영역을 넘어 다양한 조건의 데이터를 확보하는 데 도움이 됐습니다.
하지만 넓게 수집하는 것만으로는 충분하지 않았습니다. 최적 운전 영역 안에도 운전 데이터는 존재했지만, 그 안에서 팬 출력을 조금씩 바꿨을 때 온도와 차압이 어떻게 달라지는지 학습하기에는 충분하지 않았습니다. 결국 필요한 것은 운전 범위 전체를 고르게 살펴보는 데서 나아가, 자율제어에 필요한 영역의 데이터를 더 집중적으로 모으는 일이었습니다.
LG CNS는 이 문제를 해결하기 위해 세 가지 요소를 연결했습니다. 자율제어를 위한 학습 데이터를 얻도록 필요한 지점을 골라 탐색하는 ‘능동 실험’, 전산실 전체와 구역별 정보를 함께 활용해 설비의 반응을 예측하는 ‘융합 모델’, 제어 명령을 실행하기 전에 검증하고 실행 후에도 이상을 감시하는 ‘세이프가드’입니다. 그림 7은 이 세 요소가 데이터를 주고받으며 자율제어를 수행하는 구조를 보여 줍니다.

[그림 7] 세 구성이 데이터를 주고받으며 도는 통합 운전 루프
a. 능동 실험 에이전트 — 필요한 지점을 골라 실험
첫 번째는 이전 실험의 결과를 바탕으로 다음에 시험할 팬 출력 조합을 선택하는 능동 실험입니다. LG CNS가 개발한 에이전트(Active Reliability Agent, ARA)는 지금까지 수집한 데이터를 이용해 안전 기준을 지키면서 전력을 더 줄일 수 있을 것으로 예상되는 조합을 고릅니다. 해당 조합으로 설비를 운전해 온도와 차압, 전력 사용량을 확인하고, 그 결과를 다음 실험을 선택하는 데 반영합니다. 이때, 최적화를 수행하는 기법은 확장형 제약 베이지안 최적화(Scalable Constrained Bayesian Optimization, SCBO)를 사용했습니다.7) 이 과정을 반복하면서 자율제어에 필요한 운전 영역의 데이터를 집중적으로 쌓게 되는데, 핵심은 제한된 실험 횟수 안에서 전력 절감 가능성을 확인하고, 팬 출력 변화에 따른 설비의 반응을 학습할 수 있도록 다음 실험을 고르는 데 있습니다.
b. 전역·구역 융합 모델 기반 MPC — 전체와 구역별 반응을 함께 예측
두 번째는 전산실 전체와 각 구역의 정보를 함께 활용하여 예측을 수행하는 전역·구역 융합 예측 모델(Global + Local Hybrid Model)입니다. 전산실의 열 전달은 구역 내에서 주로 이루어지지만 전체 전산실은 물리적으로 연결되어 있기 때문에 구역 간에 일어나는 영향 역시 무시할 수 없습니다.

[그림 8] 전산실 전체와 구역별 정보를 활용하는 전역·구역 융합 예측 모델
그림 8을 왼쪽부터 보겠습니다. 전산실 내 8개 구역의 온도·차압·팬 제어 데이터가 모델에 들어갑니다. 파란색의 전역 모델(Global Encoder)은 전산실 전체의 변화와 구역 간 영향을 파악하고, 녹색의 구역별 모델(Zone-Local Model)은 각 구역의 고유한 반응을 학습합니다. 두 정보를 융합해 그림의 오른쪽처럼 팬 출력에 따른 구역별 온도와 차압 변화를 예측합니다. 이를 통해 각 구역의 특징을 살린 예측을 하면서도, 한 구역의 팬 설정이 주변 구역의 온도와 차압에 미치는 영향까지 함께 반영하여 예측 성능을 높였습니다.

[그림 9] 실제 온도와 각 모델의 30분 예측 결과 비교
그림 9는 한 구역의 실제 온도와 각 모델이 30분 동안의 온도를 예측한 결과를 비교한 사례입니다. 실제 온도를 나타내는 검정 실선과 각 모델의 예측선을 비교해보면, ‘best model’로 표시한 전역·구역 융합 모델의 분홍 실선이 다른 모델의 점선보다 실제 온도에 전반적으로 가깝습니다. 특히 중반에 온도가 낮아졌다가 후반에 다시 상승하는 흐름까지 잘 예측하는 것을 볼 수 있습니다.
이 모델은 MPC가 다음 팬 설정을 결정하는 데에 대리 모델로 사용됩니다. MPC는 최적의 팬 조합을 찾아내기 위해 여러 팬 출력 설정 후보를 만들고, 대리 모델을 이용하여 각 후보에 따른 환경값의 반응을 미리 계산합니다. 그중 온도와 차압 조건을 지키면서 전력을 가장 적게 쓰는 최적 팬 조합 후보를 골라 실제 냉방 제어로 연결합니다.
c. 세이프가드 — 실행 전 검증하고, 이상할 땐 사람이 제어한다
셋째는 세이프가드(SafeGuard)입니다. 세이프가드는 MPC가 최적화한 팬 조합 제안이 설비로 전달되기 전에 전문가 운전 규칙과 물리적 한계 조건을 대조합니다. 조건을 통과하지 못한 후보는 기각하고, MPC가 다른 후보를 계산하도록 돌려보냅니다.

[그림 10] 이상 징후의 단계에 따른 세이프가드의 안전 전환과 제어권 반환
그림 10은 명령을 실행한 뒤 이상 수준이 커짐에 따라 제어권이 어떻게 이동하는지 보여 줍니다. NORMAL 단계에서는 AI가 1분 주기로 팬 설정을 다시 계산하며 자율제어를 수행합니다. 이상 징후가 감지되면 WATCH 단계로 넘어가 해당 구역에 알람을 띄우고 집중 감시에 들어갑니다. 위험이 커지면 MPC 최적화를 중단하고 FAILSAFE 단계로 전환해 최소 성능을 보장하는 안전 운전 상태를 확보합니다. AI 제어 중 통신이 끊기는 등 제어를 지속할 수 없는 상황에서도 이러한 안전 전환은 자동으로 이루어집니다. 이상이 더 심각하면 운영자에게 알리며 HUMAN 단계로 넘어가 제어권을 돌려줍니다. 상황이 복구되면 운영자의 승인하에 다시 NORMAL 단계로 돌아옵니다. 실행 전 검증과 실행 후 감시를 분리한 것이 세이프가드의 핵심입니다.
이 구조 덕분에 운영자가 매번 명령을 승인하지 않아도 안전 기준을 지킨 자율제어가 가능해졌습니다. 운영자는 허용 범위와 예외 처리 원칙을 정하고, 시스템이 그 범위를 벗어날 때 다시 제어권을 가져갑니다.
IT 부하, 외기 온도, 시간대에 따라 최적 팬 조합은 실시간으로 달라집니다. 그러므로 조건이 다른 두 구간을 그대로 비교하면 제어 효과를 분리해 보기 어렵습니다. 이번 실증에서는 대상 설비와 안전 기준을 동일하게 두고, 기존 PID 고정 운전과 AI 자율제어의 팬 전력량을 유사한 환경에서 측정하기 위해 같은 시간을 기준으로 비교했습니다.
| 구분 | 비교 조건 |
| 기존 운전 | PID 기반 고정 운전 구간 |
| AI 제어 | MPC 자율제어 구간 |
| 대상 | 전산실 1개 · 8개 열 구역 · FWU 32대 |
| 안전 조건 | 쿨존 ≤ 26°C · 핫존 ≤ 36°C · 차압 ≥ 5Pa |
[표 2] 실증 대상과 비교 기준

[그림 11] 기존 운전 구간과 AI 제어 구간의 팬 출력·쿨존 온도
그림 11은 기존 PID 운전 구간(왼쪽)과 AI 제어 구간(오른쪽)을 비교합니다. LG CNS가 줄이려는 전력에 해당하는 팬 출력이 그림의 상단에, 그리고 안전을 위한 기준인 온도와 차압이 중간과 하단에 함께 나타나 있습니다. 그림에서 AI 제어 구간에서 팬 출력은 낮아졌지만, 검증 구간 동안 쿨존 SLA 상한과 핫존 상한을 넘기지 않았으며, 차압(하단)은 평균 7.2Pa로 하한 5Pa보다 여유 있게 유지됐습니다. 해당 자율제어 실증은 24.6시간 연속으로 동작한 결과였습니다.

[그림 12] 동일 조건으로 환산한 팬 전력량 비교
AI가 제어한 검증 구간 중 안정화 구간을 제외한 22시간을 기준으로 측정한 팬 전력량은, 기존 고정 운전 2,016kWh에서 AI 제어 시 1,458kWh로 절감됐습니다. 차이는 558kWh, 절감률은 27.7%입니다. 현재 내부 환산 기준으로 하남 DC 대상 연 약 1억 8,000만 원의 비용 절감이 가능한 수준입니다.
절감 요인은 두 가지로 볼 수 있습니다. 먼저 부하가 낮은 시간대의 불필요한 냉방 여유를 줄였습니다. 다음으로 열이 적은 구역의 팬 출력을 낮추고 냉방이 필요한 구역으로 다시 배분했습니다.
LG CNS가 AI 자율제어 실증에 성공한 요인은 세 가지입니다. 데이터 수집은 배울 가치가 큰 지점을 골라 실험하는 능동 실험으로 수행했고, 예측은 전역·구역의 영향을 융합한 모델을 사용했습니다. 안전은 허용 범위를 걸어 두는 데서 멈추지 않고, 매 명령을 검증해 이상 수준에 따라 운영자에게 제어권을 돌려주는 계층으로 확장했습니다.
실제 운영 환경에서 자율제어를 검증하고 그 방법까지 공개한 사례는 구글과 메타를 포함해 손에 꼽습니다. 이번 실증은 여기에 조건이 하나 더 까다로운 사례를 더합니다. 자사 인프라가 아니라 고객 서비스가 가동 중인 상용 전산실에서, 시뮬레이터 없이, 주어진 안전 기준을 그대로 지킨 채 얻은 결과입니다.
A1. 아닙니다. 데이터센터 냉방 AI 자율제어가 도입되면 데이터센터 운영자의 역할이 바뀝니다. 지금까지 운영자의 시간은 “매 시각 설정값을 어떻게 둘 것인가”에 쓰였습니다. 자율제어가 도입되면 그 시간이 경계를 설계하는 일로 옮겨 갑니다. 어떤 값까지 허용할 것인지, 무엇을 얼마나 위험하다고 볼 것인지를 정하는 일입니다. 알고리즘이 대신할 수 없는, 조직의 판단이 필요한 영역입니다.
매 시각 값을 조정하던 사람이, 시스템이 무엇을 해도 되고 무엇을 하면 안 되는지를 설계하는 사람이 됩니다. 예외 판단과 승인, 검증도 여전히 사람의 몫입니다.
A2. 데이터센터 냉방 AI 자율제어 구조는 재사용됩니다. 제어 엔진과 비용 함수, 모델 구조, 안전 계층, 배포 방식은 그대로 옮겨 갑니다. 구역 수나 임계값은 설정으로 바꿀 수 있도록 처음부터 설정 중심으로 설계했기 때문에, 코드를 고치지 않고도 사이트를 바꿀 수 있습니다. 다만 학습된 가중치는 반드시 다시 학습해야 합니다. 건물마다 공기가 도는 방식이 다르기 때문입니다.
그런데 실제로 이식 비용을 좌우하는 건 소프트웨어가 아닙니다. 대상 사이트의 센서 태그를 맞추고, 그 센서가 정말 무엇을 재고 있는지 확인하고, 안전 임계값을 운영팀과 합의하고, 실험 데이터 수집 승인을 받는 일입니다. 현장마다 이 확인 작업은 반드시 거쳐야 합니다. 다만 설정 중심 구조와 재사용 가능한 제어·안전 계층 덕분에, 처음부터 다시 개발하는 것보다는 훨씬 적은 데이터와 재학습 비용으로 옮길 수 있습니다.
A3. 냉방 에너지 절감은 안전 기준을 낮추는 방식으로 만들지 않습니다. 이번 실증에서는 쿨존 26°C, 핫존 36°C, 차압 5Pa라는 기준을 그대로 두고, 그 범위 안에서 과냉각 여유만 줄였습니다. 검증 구간의 온도 기준 초과 시간은 0분이었고 차압도 하한 이상을 유지했습니다.
또한 세이프가드가 제어 명령을 실행 전에 검증하고, 실행 후에는 센서 상태를 감시합니다. 이상이 커지면 안전 상태로 전환하거나 운영자에게 제어권을 돌려줍니다.
A4. 아닙니다. 데이터센터 냉방 AI 자율제어 계층은 기존 제어 체계를 대체하기보다 그 위에서 다음 운전값을 계산하고 안전 조건을 확인합니다. 자율제어를 종료하거나 이상이 감지되면 기존 운전 방식으로 전환할 수 있도록 설계했습니다.
1) Gartner, <Gartner Says Data Center Electricity Consumption to Grow 26% in 2026>
2) Google DeepMind, <DeepMind AI Reduces Google Data Centre Cooling Bill by 40%>
3) Google DeepMind, <Safety-first AI for autonomous data centre cooling and industrial control>
4) NeurIPS, <Data center cooling using model-predictive control>
5) Meta Engineering·OpenReview, <Simulator-Based Reinforcement Learning for Data Center Cooling Optimization>
6) AAAI, <Fast 3D Surrogate Modeling for Data Center Thermal Management>
7) PMLR, <Scalable Constrained Bayesian Optimization>
8) Applied Energy, <Reinforcement learning for data center energy efficiency optimization: A systematic literature review and research roadmap>
9) ICLR, <Data Center Cooling System Optimization Using Offline Reinforcement Learning>
본 콘텐츠는 저작권법에 의해 보호받는 저작물로 LG CNS에 저작권이 있습니다.
사전 동의 없이 2차 가공 및 영리적인 이용을 금합니다.
기업명을 두 글자 이상 입력해주세요.
소식을 받아 보시려면 마케팅 정보 활용과 마케팅 정보 수신에 모두 동의해 주셔야 합니다.
제출이 완료되었습니다.
제출이 완료되었습니다.
확인 버튼을 누르시면 자사 홈페이지 홈화면으로 이동됩니다.
요청하신 자료가 이메일로 발송되었습니다.
구독 설정이 저장되었습니다.
잘못된 접근입니다. 정상적인 경로를 통해 다시 시도해 주세요.
검색 중 오류가 발생했습니다. 다시 시도해주세요.
제출에 실패하였습니다.
다시 시도해주세요.
사업자등록번호는 10자리를 입력해주세요.
지원하지 않는 파일 형식입니다.
10MB 이하의 파일만 업로드하실 수 있으며, 최대 10개까지 첨부 가능합니다.
10MB 이하의 파일만 업로드하실 수 있습니다.
파일은 최대 10개까지만 첨부하실 수 있습니다.
업로드 중 오류가 발생했습니다. 다시 시도해 주세요.
파일을 교체하시겠습니까?