
model: deepseek-v4-flash-0731
[batch] p1 answer ... 422 tok in 30 s (14.0 tok/s), 0 answer chars, 4436 reasoning chars, <= 15.8 h left
[batch] p1 answer ... 846 tok in 60 s (14.1 tok/s), 0 answer chars, 9732 reasoning chars, <= 15.8 h left
[batch] p1 answer ... 1273 tok in 2 min (14.1 tok/s), 0 answer chars, 14807 reasoning chars, <= 15.7 h left
[batch] p1 answer ... 1692 tok in 2 min (14.1 tok/s), 0 answer chars, 19498 reasoning chars, <= 15.7 h left
[batch] p1 answer ... 2119 tok in 3 min (14.1 tok/s), 0 answer chars, 24208 reasoning chars, <= 15.7 h left
[batch] p1 answer ... 2540 tok in 3 min (14.1 tok/s), 0 answer chars, 29422 reasoning chars, <= 15.7 h left
[batch] p1 answer ... 2961 tok in 4 min (14.1 tok/s), 0 answer chars, 34814 reasoning chars, <= 15.7 h left
[batch] p1 answer ... 3381 tok in 4 min (14.1 tok/s), 0 answer chars, 40060 reasoning chars, <= 15.7 h left
[batch] p1 answer ... 3801 tok in 5 min (14.1 tok/s), 0 answer chars, 45535 reasoning chars, <= 15.7 h left
[batch] p1 answer ... 4223 tok in 5 min (14.1 tok/s), 0 answer chars, 50300 reasoning chars, <= 15.7 h left
[batch] p1 answer ... 4641 tok in 6 min (14.0 tok/s), 0 answer chars, 54854 reasoning chars, <= 15.7 h left
[batch] p1 answer ... 5061 tok in 6 min (14.0 tok/s), 0 answer chars, 59818 reasoning chars, <= 15.7 h left
[batch] p1 answer ... 5479 tok in 7 min (14.0 tok/s), 0 answer chars, 65113 reasoning chars, <= 15.7 h left
[batch] p1 answer ... 5895 tok in 7 min (14.0 tok/s), 0 answer chars, 70328 reasoning chars, <= 15.7 h left
[batch] p1 answer ... 6312 tok in 8 min (14.0 tok/s), 0 answer chars, 75546 reasoning chars, <= 15.7 h left
[batch] p1 answer ... 6734 tok in 8 min (14.0 tok/s), 0 answer chars, 80835 reasoning chars, <= 15.7 h left
Setting was done from yesterday and today I finished setting it up and ran it.
It's about 14tok/s.
I tried to get the answer by adopting Fable's analysis method as it is, and
Since I got a convincing level of answer in the test, I am quite surprised.
The answer is significantly more accurate than models under 100B, so I've been slightly surprised since yesterday.
I definitely think that 1M context and parameter size are a brute force for now.
Running two DGX SPARKs makes me regret not buying the Mac Studio with 512G, but
The cost-effectiveness is too low to expand further in terms of hardware...
I hope that a smarter open-weight model will be released in time.