Gần đây mình xem Grass — có một điều thật sự làm mình “click”: khi AI ngày càng lớn hơn, chỉ riêng việc *vào* được web công khai đã là một “ngành” kinh doanh hoàn toàn rồi.
Ngày càng nhiều trang web dựng tường chặn chống bot ở khắp nơi. IP Cloud? Bị chặn. Lưu lượng VPN? Bị lọc rất gắt. Trong khi đó, các phòng thí nghiệm AI lại đang thiếu dữ liệu công khai mới.
Grass về cơ bản dùng kết nối internet dân cư phân tán — IP nhà thật — để giúp các công ty AI thu thập các nội dung công khai mà không bị chặn cửa.
Nghe có vẻ còn hẹp lúc này, nhưng hãy nghĩ xem: khi các mô hình mở rộng hơn, chúng càng cần dữ liệu được cập nhật liên tục. Và nếu một nửa web chặn bạn ngay từ mặc định… thì đột nhiên “lớp truy cập” đó không còn là thứ “có thì tốt” nữa. Nó là hạ tầng.
Thật hơi điên rồ: điểm nghẽn giờ không còn là năng lực tính toán hay thậm chí bản thân dữ liệu — mà là khả năng *nhìn thấy* dữ liệu ngay từ đầu.
Ngày càng nhiều trang web dựng tường chặn chống bot ở khắp nơi. IP Cloud? Bị chặn. Lưu lượng VPN? Bị lọc rất gắt. Trong khi đó, các phòng thí nghiệm AI lại đang thiếu dữ liệu công khai mới.
Grass về cơ bản dùng kết nối internet dân cư phân tán — IP nhà thật — để giúp các công ty AI thu thập các nội dung công khai mà không bị chặn cửa.
Nghe có vẻ còn hẹp lúc này, nhưng hãy nghĩ xem: khi các mô hình mở rộng hơn, chúng càng cần dữ liệu được cập nhật liên tục. Và nếu một nửa web chặn bạn ngay từ mặc định… thì đột nhiên “lớp truy cập” đó không còn là thứ “có thì tốt” nữa. Nó là hạ tầng.
Thật hơi điên rồ: điểm nghẽn giờ không còn là năng lực tính toán hay thậm chí bản thân dữ liệu — mà là khả năng *nhìn thấy* dữ liệu ngay từ đầu.