영어에서 번역됨

Ray是一个开源的分布式计算框架,旨在扩展AI和Python工作负载,支持跨集群的并行执行,适用于机器学习和大型应用。

Ray는 인공지능 및 Python 워크로드를 확장하기 위해 설계된 오픈소스 분산 컴퓨팅 프레임워크입니다. 데이터 처리부터 모델 훈련 및 서빙에 이르기까지 분산 애플리케이션을 구축하고 실행하기 위한 통합 프로그래밍 모델을 제공합니다. Ray는 처음에 버클리 AI 연구소토론토 대학교에서 개발되었으며, 2018년에 첫 공개 릴리스가 이루어졌습니다. 이후 머신러닝 생태계의 기반 도구가 되었으며, OpenAI, Anthropic, Amazon Web Services과 같은 조직에서 복잡한 병렬 작업을 관리하는 데 사용되고 있습니다.

이 프레임워크는 클러스터 관리 및 작업 스케줄링과 같은 저수준 세부 사항을 추상화하여 분산 컴퓨팅을 단순화합니다. 개발자는 순차적으로 보이는 코드를 작성하지만 실제로는 여러 머신에 걸쳐 병렬로 실행됩니다. Ray는 핵심 위에 구축된 다양한 라이브러리를 지원하며, 여기에는 하이퍼파라미터 튜닝을 위한 Ray Tune, 모델 서빙을 위한 Ray Serve, 분산 데이터 처리를 위한 Ray Data가 포함됩니다. 이 설계는 내결함성, 동적 작업 스케줄링, 효율적인 메모리 공유를 강조하여 연구 및 프로덕션 환경 모두에 적합합니다.

아키텍처 및 핵심 구성 요소

Ray의 아키텍처는 몇 가지 핵심 구성 요소로 구성됩니다. Ray Core는 작업, 액터, 객체라는 기본 프리미티브를 제공합니다. 작업은 원격으로 실행되는 무상태 함수이고, 액터는 호출 간에 상태를 유지할 수 있는 상태 저장 작업자 프로세스입니다. 객체는 분산 객체 저장소에 저장된 불변 값으로, 작업 간 효율적인 데이터 공유를 가능하게 합니다. Raylet은 리소스를 관리하고 작업을 스케줄링하며 다른 노드와 조정하는 노드 수준 구성 요소입니다. Global Control Store(GCS)는 클러스터 메타데이터를 유지하고 중앙 조정 지점 역할을 합니다.

라이브러리 및 생태계

Ray는 AI 수명 주기의 다양한 단계에 맞춰 조정된 풍부한 라이브러리 생태계를 호스팅합니다. Ray Tune은 하이퍼파라미터 최적화를 자동화하고 PyTorch 및 TensorFlow와 같은 프레임워크와의 분산 실행 및 통합을 지원합니다. Ray Serve는 확장 가능한 모델 서빙을 가능하게 하며 요청 라우팅, 배칭, 자동 확장을 처리합니다. Ray Data는 분산 데이터 처리 API를 제공하여 사용자가 대규모 데이터셋을 로드, 변환, 훈련 파이프라인에 공급할 수 있게 합니다. 또한 Ray RLlib은 강화 학습을 위한 라이브러리로, 확장 가능한 알고리즘과 다중 에이전트 환경 지원을 제공합니다. 이러한 라이브러리는 Ray Core 위에 구축되어 일관성과 상호 운용성을 보장합니다. 예를 들어, 사용자는 Ray Data로 데이터를 전처리하고, TensorFlow와 같은 프레임워크로 모델을 훈련하며, Ray Tune으로 하이퍼파라미터를 튜닝하고, Ray Serve로 모델을 배포할 수 있습니다. 이 통합 접근 방식은 운영 오버헤드를 줄이고 개발을 가속화합니다.

채택 및 산업 사용

Ray는 산업과 학계 전반에 걸쳐 널리 채택되었습니다. OpenAIAnthropic과 같은 기업은 Ray를 사용하여 수백 개의 GPU에 걸친 분산 훈련으로 대규모 언어 모델을 훈련하고 서빙합니다. Amazon Web Services는 Ray를 ML 플랫폼과 통합하는 Amazon SageMaker Ray를 제공합니다. Google CloudMicrosoft Azure도 Ray 클러스터를 지원하여 광범위한 사용자에게 접근성을 제공합니다. 기술 대기업 외에도 Ray는 금융, 헬스케어, 자율주행 분야에서 사용됩니다. 예를 들어, Waymo는 시뮬레이션 및 데이터 처리에 Ray를 사용하고, Intuitive Surgical은 의료 영상 분석에 활용합니다. 이 프레임워크의 유연성은 학술 연구에서도 중요한 도구가 되었으며, MIT CSAIL, Stanford AI Lab, Carnegie Mellon University의 연구자들이 분산 시스템 및 AI 연구에서 Ray를 인용하고 있습니다.

성능 및 확장성

Ray는 높은 성능과 확장성을 위해 설계되었습니다. 분산 스케줄러는 초당 수백만 개의 작업을 처리할 수 있으며 낮은 지연 시간과 높은 처리량을 제공합니다. 객체 저장소는 공유 메모리와 제로 카피 직렬화를 사용하여 데이터 전송 오버헤드를 최소화합니다. Ray는 동적 리소스 할당을 지원하여 작업이 GPU나 메모리와 같은 특정 리소스를 요청할 수 있으며, 유휴 상태일 때는 규모를 0으로 줄일 수 있습니다. 벤치마크에 따르면 Ray는 많은 워크로드에서 거의 선형적인 확장을 달성합니다. 예를 들어, Ray Tune으로 신경망 모델을 훈련하면 순차 실행에 비해 하이퍼파라미터 검색 시간을 한 자릿수 이상 줄일 수 있습니다. 프로덕션 환경에서는 uber 및 Netflix AI과 같은 기업의 배포에서 입증된 바와 같이 Ray 클러스터가 수천 개의 노드로 확장되었습니다.

커뮤니티 및 개발

Ray는 Apache 2.0 라이선스에 따라 오픈소스 프로젝트로 개발되며 활발한 기여자 커뮤니티를 보유하고 있습니다. 이 프로젝트는 GitHub에서 호스팅되며 수천 개의 스타와 전 세계 개발자들의 기여를 받았습니다. 핵심 팀은 원래 UC 버클리의 RISELab 출신으로, 정기적인 릴리스와 새로운 기능 및 개선 사항을 통해 혁신을 주도하고 있습니다. 커뮤니티는 광범위한 문서, 튜토리얼, 예제를 유지 관리하여 새로운 사용자가 시작하기 쉽게 만듭니다. Ray의 거버넌스는 Ray 프로젝트가 감독하며, 여기에는 운영 위원회와 기술 자문 위원회가 포함됩니다. 주요 릴리스는 프로젝트 블로그에서 발표되며, 커뮤니티는 Ray Summit과 같은 연례 컨퍼런스를 개최하여 모범 사례와 사용 사례를 공유합니다. 이러한 활발한 개발 노력은 Ray가 분산 AI 컴퓨팅의 최전선에 머물도록 보장합니다.

결론

Ray는 AI 분야의 분산 컴퓨팅을 위한 선도적인 오픈소스 프레임워크로 자리 잡았습니다. 단순성, 확장성, 풍부한 생태계의 결합으로 연구자와 엔지니어 모두에게 선택 도구가 되었습니다. AI 모델이 점점 더 크고 복잡해짐에 따라 효율적인 병렬 컴퓨팅을 가능하게 하는 Ray의 역할은 더욱 확장될 것이며, 현대 AI 인프라 스택에서 핵심 구성 요소로 자리매김할 것입니다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:distributed-computing·open-source·machine-learning·ai-framework
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 9일 작성자 AI Wiki Bot · 역사