a2sys와 함께하는 새로운 도전에 초대합니다.
a2sys는 기존 LLM과 GPU 중심 서빙의 한계를 넘어 모델 최적화, 서빙 소프트웨어/시스템, 차세대 메모리를 하나로 연결하는 새로운 Agent-native Computing Solution을 구축하고자 합니다. 이를 위해 다양한 영역의 우수 인재들을 기다리고 있습니다.
사무실은 판교역에서 도보 10분 거리에 위치할 예정이며, 합류하시는 분들이 최고의 몰입을 경험하실 수 있도록 업계 최고 수준의 근무 환경과 복지, 처우를 준비 중입니다. 대한민국에서, 그리고 더 나아가 글로벌 시장에서 새로운 AI 시스템 생태계를 만들어갈 분들의 많은 지원과 관심을 부탁드립니다.
이하는 현재 오픈되어 있는 포지션 (Agent Platform / LLM Modeling / LLM Inference / AI Infrasturcture) 에 대한 설명입니다.
에이전트를 정의하고 실행하는 플랫폼의 백엔드와 런타임을 만드는 역할입니다. 에이전트 제품에서는 모델 성능만큼 실행의 신뢰성이 품질을 좌우합니다. 실행 계층의 안정성과 실행 추적을 책임집니다.
에이전트는 같은 입력에도 다르게 움직이고 실패하는 방식도 예측하기 어렵습니다. 실행 상태와 메모리, 도구 호출과 모델 호출의 기록을 설계해 무엇이 어디서 잘못됐는지 되짚을 수 있게 만듭니다.
에이전트 실행 런타임을 개발합니다. 세션 라이프사이클, 취소와 타임아웃, 재시도, 오류 처리를 다룹니다.
에이전트 정의와 실행을 관리하는 백엔드 API와 컨트롤 플레인을 설계하고 개발합니다.
에이전트가 격리된 환경에서 실행되도록 컨테이너 기반 실행 구조를 만들고 운영 가능하게 다듬습니다.
세션 상태와 메모리 계층을 설계하고, 저장과 조회 경로를 안정화합니다.
모델 호출, 도구 호출, 상태 변화를 기록하는 실행 추적 체계를 만들고, 실패를 재현할 수 있게 합니다.
오퍼레이터 UI와의 API 계약을 정의하고, 실행 상태와 메모리, 추적 기록을 확인할 수 있도록 연결합니다.
Python 등으로 프로덕션 백엔드 API를 설계하고 운영한 경험이 있는 분
비동기·이벤트 기반 시스템에서 상태 관리와 장애 복구를 고려해 설계한 경험이 있는 분
LLM API의 streaming, structured output, tool calling을 실무에서 다뤄본 분
컨테이너 기반 실행과 격리 모델을 이해하는 분
불명확한 제품 요구를 API와 데이터 모델로 구체화할 수 있는 분
에이전트 SDK나 오케스트레이션 프레임워크를 프로덕션에 적용한 경험
workflow engine, 장시간 실행 작업 등 실행 신뢰성이 중요한 시스템을 개발한 경험
LLM 애플리케이션의 추적·관측 시스템을 구축한 경험
RAG, 지식 그래프 또는 메모리 시스템을 개발·운영한 경험
모델의 지능을 제품 요구사항에 맞게 고도화하고, 서비스 가능한 비용과 속도로 실행될 수 있도록 모델 라이프사이클 전반을 책임지는 역할입니다. 가장 거대한 모델이 항상 정답은 아닙니다. 우리 팀은 요구되는 품질을 달성하면서도 GPU 자원을 최소화할 수 있는 '똑똑하고 가벼운 특화 모델'을 지향합니다. 본 포지션은 지원자의 강점과 경험에 따라 [Track A. 에이전트 파인튜닝] 또는 [Track B. 모델 경량화 및 최적화] 중 하나의 핵심 역할을 수행하며, 인프라 및 추론 엔지니어와 긴밀하게 협업합니다.
[Track A] Agent Post-Training (에이전트 행동 및 정렬)
에이전트 워크로드(Tool calling, JSON/Structured Output, 다단계 추론)에 특화된 고품질 학습 데이터를 구축하고 정제합니다.
합성 데이터(Synthetic Data) 생성 파이프라인을 구축해 데이터 부족 문제를 해결합니다.
RLHF, DPO 등 강화학습 및 선호도 학습 기법을 적용해 에이전트의 신뢰성과 행동 품질(Alignment)을 개선합니다.
에이전트가 복잡한 시나리오에서 어떻게 동작하는지 정성적/정량적으로 진단하는 평가(Evaluation) 체계를 구축합니다.
[Track B] Model Optimization (경량화 및 가속)
양자화(Quantization) 적용 시 발생하는 품질 저하를 방지하기 위해, 데이터 기반으로 최적의 양자화 전략(PTQ, QAT)을 수립하고 검증합니다.
파라미터 수와 연산량을 줄이기 위한 지식 증류(Knowledge Distillation), 가지치기(Pruning) 등의 경량화 기법을 실험하고 적용합니다.
추론 속도를 비약적으로 높이는 스펙큘러티브 디코딩(Speculative Decoding)을 위한 작고 빠른 Draft 모델을 학습하고 튜닝합니다.
최신 모델 경량화 논문을 리서치하고 프로덕션 환경에 맞게 구현하여 GPU 비용을 극적으로 낮춥니다.
PyTorch 기반 딥러닝 모델 개발 및 Transformer 아키텍처의 내부 동작 원리를 깊이 이해하고 계신 분
Hugging Face Transformers 등을 활용해 언어 모델 파인튜닝(SFT, PEFT) 파이프라인을 직접 다뤄본 실무 경험이 있는 분
텍스트 생성 모델의 정성적/정량적 평가 지표를 이해하고, 모델의 문제점을 진단할 수 있는 분
모델의 성능(품질)과 서빙 비용(GPU 메모리, 지연시간) 사이의 트레이드오프를 데이터로 판단할 수 있는 분
[강력 우대] 모델 경량화, 추론 최적화, 스펙큘러티브 디코딩 등 관련 AI 논문 게재 실적 또는 깊은 연구 경험이 있는 분
AWQ, GPTQ, SmoothQuant 등 양자화 기법을 직접 적용하고 품질과 성능을 분석해 본 경험
PPO, DPO 등 강화학습을 활용한 언어 모델 정렬(Alignment)을 프로덕션 수준에 적용해 본 경험
도구 호출(Function Calling), 복잡한 추론(CoT)에 특화된 모델 학습 또는 합성 데이터 파이프라인 구축 경험
DeepSpeed, Megatron-LM, FSDP 등을 활용한 대규모 멀티 GPU 분산 학습 및 트러블슈팅 경험
vLLM, SGLang, TensorRT-LLM 등 추론 엔진 기반의 서빙 스택을 직접 운영하고 최적화하는 역할입니다. 추론 성능과 GPU 활용률이 곧 회사의 원가 경쟁력이 되는 환경에서, 서빙 레이어의 처리량과 지연시간, 토큰당 비용을 책임집니다.
엔진 설정 튜닝에서 끝나지 않습니다. 실행 경로를 소스 수준까지 분석해 병목을 찾고, 측정 결과를 서빙 구성과 GPU 용량 계획으로 연결합니다.
서비스 워크로드를 재현하는 추론 벤치마크를 설계하고, 지연시간과 처리량, GPU 활용률, 토큰당 비용을 측정해 운영 기준을 세웁니다.
추론 엔진의 실행 설정을 워크로드 특성에 맞게 튜닝하고, 배칭과 캐싱, 메모리 관리 방식의 효과를 정량적으로 비교합니다.
프로파일링으로 추론 경로의 병목을 찾고, 필요하면 엔진 내부 구현까지 들어가 개선합니다.
양자화처럼 성능과 품질이 맞물리는 기법의 적용 여부를 데이터로 판단합니다.
모델 서빙 구성을 설계하고, 성능 회귀를 지속적으로 잡아낼 수 있는 기준과 절차를 만듭니다.
목표 성능을 만족하는 서빙 구성과 필요한 GPU 용량을 산정하고, 인프라 팀 및 제품 팀과 배포 조건을 합의합니다.
Python으로 성능이 중요한 시스템 또는 ML 시스템을 개발하고 디버깅한 경험이 있는 분
vLLM, SGLang, TensorRT-LLM 등 추론 런타임으로 모델을 서빙하고 성능을 측정한 경험이 있는 분
Transformer 추론의 prefill/decode, attention, KV Cache, 배칭 구조를 이해하고 성능 문제에 적용할 수 있는 분
GPU 환경에서 벤치마크와 프로파일링을 직접 설계·수행하고 결과를 해석할 수 있는 분
컨테이너 기반 환경에서 추론 서비스를 배포하고 검증해 본 분
지연, 처리량, 메모리, 품질, 비용 사이의 트레이드오프를 수치로 판단할 수 있는 분
추론 엔진의 내부 구조를 분석·수정했거나 오픈소스에 기여한 경험
CUDA, Triton 등으로 GPU 커널 수준의 성능을 다뤄본 경험
저정밀 추론이나 양자화를 프로덕션에 적용하고 품질까지 검증한 경험
분산 추론, 캐시 재사용, 요청 라우팅 등으로 서빙 효율을 개선한 경험
Kubernetes와 GPU 클러스터 위에서 AI 서비스가 끊기지 않고 돌아가게 만드는 역할입니다. GPU는 회사에서 가장 비싼 자산이고, 서비스가 멈추면 제품도 멈춥니다. 인프라의 안정성과 자원 효율을 책임집니다.
클러스터와 노드, 배포 자동화, 네트워크와 보안, 관측 체계를 소유합니다. 추론 엔진의 성능 튜닝은 LLM Inference Engineer가 맡고, 이 역할은 그 위에서 다른 엔지니어가 자기 워크로드를 안전하게 올릴 수 있는 기반을 만듭니다.
GPU 클러스터와 노드를 구축하고 드라이버, 컨테이너 런타임, 노드 라이프사이클을 운영합니다.
Kubernetes 기반 배포 환경을 설계하고, IaC와 GitOps로 인프라 변경을 코드로 관리합니다.
서비스 진입점을 구성하고 TLS, 접근 제어, rate limiting 등 외부 노출 구간의 보안을 관리합니다.
시크릿, 스토리지, 권한 연동 등 여러 서비스가 공통으로 사용하는 기반을 제공합니다.
메트릭, 로그, 트레이스 수집 경로와 대시보드, SLI/SLO, 알림 체계를 구축하고 운영합니다.
부하 테스트로 용량 한계를 확인하고, 장애에 대응하며(온콜 로테이션 포함), 사후 분석으로 재발을 줄입니다.
GPU 자원의 사용률과 비용을 분석해 용량 계획과 조달을 지원합니다.
Kubernetes 기반 프로덕션 인프라를 구축하고 운영한 경험이 있는 분
Linux, 컨테이너, 네트워크 계층의 장애를 직접 분석하고 복구해 본 분
Terraform 등 IaC와 CI/CD, GitOps로 배포를 자동화한 경험이 있는 분
Go 또는 Python으로 운영 자동화 도구나 플랫폼 컴포넌트를 개발할 수 있는 분
메트릭, 로그, 트레이스를 근거로 장애 원인을 찾고 재발 방지 조치를 구현한 경험이 있는 분
보안, 신뢰성, 비용, 운영 복잡도 사이의 트레이드오프를 판단하고 조율할 수 있는 분
NVIDIA GPU 기반 클러스터를 운영하고 GPU 스케줄링과 모니터링을 다뤄본 경험
클라우드와 온프레미스 서버가 섞인 하이브리드 환경을 운영한 경험
모델 서빙 워크로드를 위한 배포와 오토스케일링 환경을 구축한 경험
SRE 또는 프로덕션 엔지니어링 경험(온콜, 인시던트 대응, 용량 계획)