Qwen 3.8 flash thực sự rất ấn tượng, và llama.cpp liên tục được cải thiện nhanh chóng trong việc xử lý nó
các cột bao gồm: prompt có sẵn, prompt mới, bản sinh ra, input tok/s, output tok/s
Đây là trên laptop của tôi (strix halo). Tôi nghĩ chúng ta đã rất gần thời điểm mà bạn có thể chỉ cần dùng mô hình chạy cục bộ cho phần lớn các tác vụ, và với những việc nâng cao hơn, các quy trình như "dùng mô hình cục bộ của bạn để điều phối các truy vấn tới các mô hình mạnh mẽ hơn sao cho các truy vấn của bạn không bị rò rỉ thông tin cá nhân" thực sự trở nên khả thi.
các cột bao gồm: prompt có sẵn, prompt mới, bản sinh ra, input tok/s, output tok/s
Đây là trên laptop của tôi (strix halo). Tôi nghĩ chúng ta đã rất gần thời điểm mà bạn có thể chỉ cần dùng mô hình chạy cục bộ cho phần lớn các tác vụ, và với những việc nâng cao hơn, các quy trình như "dùng mô hình cục bộ của bạn để điều phối các truy vấn tới các mô hình mạnh mẽ hơn sao cho các truy vấn của bạn không bị rò rỉ thông tin cá nhân" thực sự trở nên khả thi.
