Files
tinygrad/examples
chenyuandGitHub 22d5def113 download llama3 70B (#7868)
use "nvidia/Llama-3.1-Nemotron-70B-Instruct-HF".
```
PYTHONPATH=. JITBEAM=2 python3 examples/llama3.py --download_model --size 70B --quantize int8 --benchmark
```

on M4 Max, 40 sec to load the model and
```
enqueue in 165.15 ms
total 328.54 ms, 3.04 tok/s, 247.46 GB/s, param 221.20 GB/s

enqueue in   5.31 ms
total 168.48 ms, 5.94 tok/s, 482.54 GB/s, param 431.34 GB/s

enqueue in   5.32 ms
total 168.77 ms, 5.93 tok/s, 481.71 GB/s, param 430.60 GB/s

enqueue in   5.69 ms
total 169.51 ms, 5.90 tok/s, 479.61 GB/s, param 428.72 GB/s

enqueue in   5.41 ms
total 168.60 ms, 5.93 tok/s, 482.20 GB/s, param 431.04 GB/s

enqueue in   5.18 ms
total 168.98 ms, 5.92 tok/s, 481.12 GB/s, param 430.08 GB/s

enqueue in   5.43 ms
total 168.82 ms, 5.92 tok/s, 481.59 GB/s, param 430.49 GB/s

enqueue in   5.27 ms
total 168.94 ms, 5.92 tok/s, 481.23 GB/s, param 430.17 GB/s
```
2024-11-23 12:18:31 -05:00
..
2024-07-14 11:09:58 -07:00
2024-11-06 14:23:55 +08:00
2023-03-11 16:28:10 -08:00
2024-09-24 10:08:04 +08:00
2024-11-12 22:11:40 -05:00
2024-11-03 11:26:10 +08:00
2024-11-14 17:56:02 +08:00
2023-10-30 18:42:26 -07:00
2024-11-23 12:18:31 -05:00
2024-07-03 09:06:01 -07:00
2024-07-02 21:39:01 -04:00
2024-07-03 22:47:10 -04:00
2024-09-25 17:45:13 +08:00
2024-11-01 13:57:01 -04:00
2024-05-22 20:43:21 -04:00
2024-11-14 17:56:02 +08:00
2023-11-28 17:36:55 -08:00
2023-12-08 12:59:38 -08:00
2024-11-14 17:56:02 +08:00