Kỹ sư phần mềm · Hệ thống backend & nền tảng AI · Hà Nội, Việt Nam
Tôi xây những hệ thống chạy im lặng ở phía sau — nơi không ai nhìn thấy, nhưng hỏng một giây là cả sản phẩm đứng lại.
~/le-hieu
$whoami
le-hieu — software engineer, 7 years
backend systems · distributed services · AI infrastructure
$cat focus.txt
Thiết kế hệ thống chịu tải cao
Đưa mô hình AI vào môi trường thật
Giảm độ trễ, giảm chi phí hạ tầng
$git log --oneline -3
a3f9c21 feat: giảm p99 latency từ 840ms xuống 120ms
7b2e04d refactor: tách monolith thành 6 service độc lập
1c8d5fa perf: cắt 62% chi phí suy luận mô hình
01
Về tôi
Tôi bắt đầu bằng việc viết API cho một startup thương mại điện tử, nơi mỗi đợt khuyến mãi là một bài kiểm tra xem hệ thống có sập không. Bảy năm sau, thứ tôi quan tâm vẫn không đổi: làm sao để hệ thống chịu được lúc đông nhất, và làm sao để người sau đọc mã của tôi mà không phải chửi thầm.
Vài năm gần đây tôi làm nhiều với hạ tầng cho mô hình AI — phần việc nằm giữa nghiên cứu và sản phẩm: đưa một mô hình chạy được trong phòng thí nghiệm ra phục vụ hàng nghìn người mỗi phút, với chi phí mà công ty còn trả nổi.
Mã nguồn tốt không phải mã thông minh nhất. Là mã mà sáu tháng sau người khác vẫn sửa được mà không sợ.
02
Kinh nghiệm
7 năm làm nghề
2023 — nay
Kỹ sư phần mềm cấp cao
Nền tảng AI nội bộ · Công ty công nghệ
Thiết kế lớp phục vụ mô hình cho toàn công ty. Gộp 4 hệ thống suy luận rời rạc thành một nền tảng chung, giảm 62% chi phí GPU và rút thời gian đưa mô hình mới lên môi trường thật từ 3 tuần xuống 2 ngày.
GoPythonKubernetesTritongRPC
2021 — 2023
Kỹ sư backend
Sàn thương mại điện tử
Phụ trách hệ thống đơn hàng và thanh toán. Tách khối nguyên liền thành 6 dịch vụ độc lập, đưa p99 từ 840ms xuống 120ms và giữ hệ thống không sập qua ba mùa cao điểm.
JavaKafkaPostgreSQLRedis
2019 — 2021
Lập trình viên
Startup công nghệ tài chính
Người thứ tư trong đội kỹ thuật. Viết API, dựng CI/CD, trực sự cố. Giai đoạn học được nhiều nhất vì mọi thứ hỏng đều là việc của mình.
Node.jsTypeScriptAWSDocker
03
Dự án
Vài việc đáng kể nhất, kèm con số thật.
2024Go · Kubernetes · Triton · Prometheus
Nền tảng phục vụ mô hình AI
Một cổng duy nhất cho mọi mô hình trong công ty
Hệ thống định tuyến yêu cầu tới đúng mô hình, tự gom lô để tận dụng GPU, tự thu nhỏ khi vắng khách. Phục vụ hơn 40 triệu lượt suy luận mỗi tháng.
40M+lượt/tháng
−62%chi phí GPU
99,95%thời gian sống
2022Java · Kafka · PostgreSQL
Tách hệ thống đơn hàng
Từ một khối nguyên liền thành sáu dịch vụ
Tách dần trong 9 tháng mà không dừng hệ thống một phút nào. Mỗi bước đều có đường lùi. Kết quả là mỗi đội tự triển khai được phần của mình mà không phải chờ nhau.
840→120msđộ trễ p99
0phút gián đoạn
6dịch vụ độc lập
2021Python · Kafka · Redis · XGBoost
Hệ thống phát hiện gian lận
Chặn giao dịch đáng ngờ trong thời gian thực
Luồng xử lý thời gian thực chấm điểm rủi ro từng giao dịch dưới 50ms. Phần khó không phải mô hình, mà là làm sao không chặn nhầm khách hàng thật.
< 50msthời gian chấm điểm
−78%giao dịch gian lận
04
Kỹ năng
Ngôn ngữ
Go
Python
TypeScript
Java
SQL
Hạ tầng
Kubernetes
Docker
AWS
Terraform
CI/CD
Dữ liệu & AI
PostgreSQL
Kafka
Redis
Triton
PyTorch
Cách làm việc
Thiết kế hệ thống
Quan trắc hệ thống
Dẫn dắt kỹ thuật
Kèm cặp người mới
05
Liên hệ
Tôi nhận trao đổi về vị trí toàn thời gian, tư vấn kiến trúc hệ thống và các dự án đưa AI vào sản phẩm thật.