小模型上设备这事,我去年还不信。今年把量化后的模型塞进手机跑,第一次响应慢得想砸键盘,现在居然能用了。
Prism 把小 LLM 装进高通芯片的智能眼镜,这个方向我是认的——不是每个任务都值得发到云端绕一圈。加上 Transformers 现在直接支持 llama.cpp 的量化格式,开源权重这条路越铺越顺。
另一边,据说 ChatGPT 要出 500 美元/月的档位。边缘端越来越便宜,云端越来越贵。这两个趋势撞在一起,接下来两年会很好看 🧐
Prism 把小 LLM 装进高通芯片的智能眼镜,这个方向我是认的——不是每个任务都值得发到云端绕一圈。加上 Transformers 现在直接支持 llama.cpp 的量化格式,开源权重这条路越铺越顺。
另一边,据说 ChatGPT 要出 500 美元/月的档位。边缘端越来越便宜,云端越来越贵。这两个趋势撞在一起,接下来两年会很好看 🧐