FLockは、成功率が1,710件の複雑な意思決定テストで40.6%から77.5%へと上昇した「THIS/THATモデル1.1」をリリースしました。チームは、新バージョンが同じテストにおいてGLM-5.3、Kimi K3、DeepSeek V4.1 Flash、V4 Proを上回ったと述べています。

Foresight Newsによると、このモデルは以前の68件の意思決定テストすべてで満点を達成しており、最新のベンチマークでは19のタスクカテゴリのうち4カテゴリでGPT-5.6およびClaude Opus 5を上回り、さらに2カテゴリでは最高結果と同等でした。「予算内の最良の組み合わせ」タスクでは、成功率が67.8%に到達し、GPT-5.6の約4倍、Claude Opus 5の5倍でした。

FLockは、得られた利益は関連するベンチマーク課題に限定されており、一般的な能力ランキングを示すものではないと述べた。新バージョンは、18.8億(1.88 billion)パラメータを維持し、生成トークンはゼロであり、テストのレイテンシは約30.9ミリ秒だという。チームは改善の要因を、より大きなモデルサイズではなく学習データの最適化によるものだとし、またFLockはモデル規模と推論レイテンシを変えずに、バージョン1.0の1日後に1.1のアップグレードを公開したと語った。