Hạ tầng học máy

Dựng một cụm OCR nội bộ cho tài liệu y tế.

Bối cảnh

Khối lượng tài liệu y tế tồn đọng của khách hàng lên đến hàng trăm nghìn trang. Các API thị giác-ngôn ngữ thương mại sẽ đẩy chi phí vượt khả năng ngay trước khi quý đầu khép lại. Bản thân các tài liệu - biểu mẫu được quét, chữ viết tay xen lẫn, ảnh chụp trang - cũng vượt quá những gì OCR thông dụng đọc sạch được.

Chúng tôi đã làm gì

Chúng tôi dựng một cụm suy luận GPU. Nomad điều phối cụm. Qwen2.5-VL 8B đảm nhận việc hiểu tài liệu. Phần cứng là loại phổ thông - card Radeon RX 9060 XT, khoảng 10 triệu đồng mỗi node - chọn theo khối lượng công việc, không theo định mức của một nhân viên bán hàng. Cùng lớp điều phối đó mở rộng được trên chính các cơ sở của khách hàng, nên năng lực đi theo khối lượng chứ không phải ngược lại.

Điều gì đã thay đổi

Cấu trúc chi phí thay đổi trước tiên. Một trang giờ chỉ tốn một phần nhỏ so với giá API đám mây, và cụm máy lớn lên bằng việc thêm node, không phải bằng việc đàm phán hợp đồng. Chất lượng là phần khó tóm tắt hơn - mỗi nhóm tài liệu cần lời nhắc và bước hậu xử lý khác nhau - nhưng nền chung đủ cao để hàng đợi rà soát của khách hàng ngắn lại, không dài thêm.