CTC: 44-58 LPA
저는 @Cloudflare 의 엔지니어에게 콜드 이메일을 보냈고, 포지션과 제 경력에 대해 간단히 논의를 나누었습니다. 며칠 후 면접 초대와 함께 일정을 선택할 수 있는 링크를 받았습니다.
첫 번째 라운드는 10년 이상의 경력을 가진 리드 스태프 엔지니어와 진행되었으며, AI Workers 팀에 초점을 맞추었습니다.
Cloudflare 의 AI 스택은 꽤 흥미롭습니다. 전 세계 네트워크에 걸친 서버리스 GPU 에서 모델을 실행하고, 사용자와 더 가까운 곳에서 추론을 수행하며, 점점 더 크고 프런티어급 모델로 나아가고 있습니다.
저는 이전에 Cloudflare 의 이런 측면에 대해 잘 알지 못했기 때문에, 팀이 무엇을 구축해 왔는지, 그리고 빠르고 효율적인 AI 추론을 대규모로 어떻게 수행하는지에 대해 어느 정도 시간을 들여 논의했습니다.
그다음에는 제 경험 이야기로 넘어갔습니다.
인턴십 기간 동안 저는 GPU 에서 사내로 실행되는 인코더 기반 모델, 주로 리랭커와 임베딩 모델의 배포, rooflining, 추론 최적화 작업을 했습니다.
이들은 인코더 전용 모델로, 대부분 MLP 스택으로 구성되어 있어서 일반적인 LLM 어텐션 중심의 추론 스택, KV 캐시, vLLM 이나 SGLang 은 이런 경우에 딱히 관련이 없었습니다.
우리는 다음 주제들에 꽤 깊이 파고들었습니다:
rooflining 과 profiling 에 접근하는 방식 배치 크기 선택과 그 영향 측정 추론 워크로드 확장 추론 파이프라인 전반에서 병목 지점 찾기 p50 및 p99 지연 시간 최적화 TTFT 및 전체 응답 지연 시간
또한 명백한 병목 지점을 제거한 후에는 어떻게 추가 최적화에 접근할지에 대해서도 논의했습니다.
제가 특히 마음에 들었던 질문 하나:
프런티어 AI 란 무엇이라고 생각하나요?
라운드는 잘 진행됐고 다음 라운드에 대해서도 논의했는데, 여기에는 직접 PyTorch 를 다루는 실습이 포함될 예정이었습니다.
결국 통과하지 못했습니다. 제 생각에 그들은 더 많은 실무 LLM 추론 경험을 가진 사람을 찾고 있었던 것 같습니다. 저는 LLM 추론과 시스템에 대해 꾸준히 공부해 왔지만, 당시에는 그 분야에서 관련된 프로덕션 경험이 많지 않았습니다. 제가 직접 해온 작업의 대부분은 분산 학습, ML 시스템, 인프라와 관련된 것이었습니다.
그래도 정말 좋은 면접 경험이었습니다. 이 논의를 통해 Cloudflare 규모에서 AI 모델을 서빙할 때 관련된 문제들에 대해 훨씬 더 잘 이해하게 되었습니다.





