Qwen 3.8 flash は本当に見事で、llama.cpp もそれを処理する面で急速に、そして目に見えて改良され続けています
列は次のとおりです:既存のプロンプト、新しいプロンプト、生成された内容、入力トークン/秒、出力トークン/秒
これは私のラップトップ(strix halo)での結果です。ローカルモデルだけで大部分のタスクをこなせる段階は、もうかなり近いと思います。そして、さらに高度なことをやる場合でも、「ローカルのモデルを使って強力なモデルへのクエリをオーケストレーションし、あなたの個人情報がクエリとして漏れないようにする」といったワークフローが、実際に現実的になってきます。
列は次のとおりです:既存のプロンプト、新しいプロンプト、生成された内容、入力トークン/秒、出力トークン/秒
これは私のラップトップ(strix halo)での結果です。ローカルモデルだけで大部分のタスクをこなせる段階は、もうかなり近いと思います。そして、さらに高度なことをやる場合でも、「ローカルのモデルを使って強力なモデルへのクエリをオーケストレーションし、あなたの個人情報がクエリとして漏れないようにする」といったワークフローが、実際に現実的になってきます。
