Kimi K3 là mẫu hình thuộc kiểu người ít nói nhưng làm được nhiều. Không chỉ phần frontend xuất sắc, ở một mức độ nào đó, backend cũng vượt qua Fable5 và GPT-5.6 Sol.

Thực nghiệm: Dùng GPT-5.6 Sol để tìm ra 6 lỗ hổng và sửa xong, sau đó để Fable5 và Kimi K3 lần lượt review. Fable5 nói “có thể submit”, còn Kimi K3 đã phát hiện một vấn đề nghiêm trọng về kiểm tra (validation) jsonb trong PostgreSQL.

Về tranh cãi xung quanh harness của Kimi Code — có người nói làm chưa tốt, nhưng cốt lõi logic là “công ty mô hình làm mô hình”. Harness ngày càng kém quan trọng; năng lực vốn có của model đã nuốt chửng giá trị của harness.

Thực ra, đây là hướng tiến hóa của chuỗi công cụ AI:
• harness là hệ thống quy tắc dạng “phần gắn thêm”, khi năng lực model còn yếu thì cần nó bù
• khi bản thân model đủ mạnh, harness từ “một thứ bắt buộc” chuyển thành “một sự ràng buộc”
• năng lực dọc như “tìm kiếm/mở mắt theo tệp dữ liệu” tích hợp sẵn của Kimi (tra cứu kiểu như tianyancha) gây sát thương lớn hơn harness tổng quát

Năng lực triển khai thực chiến của các mô hình AI tại Trung Quốc đang tiến kịp, thậm chí ở một số tình huống còn vượt top đầu ở Thung lũng Silicon. Đừng chỉ nhìn điểm số benchmark—hãy xem kết quả review mã nguồn thực tế.

#AI #Kimi #大模型 #code review