Pretraining Large Language Models with NVFP4
NVIDIA, Ashwin Poojary, Michael Andersch, Brucek Khailany, Daniel Lo, Alexis Bjorlin(Broadcom (United States)), Ian Buck, Mike Chrzanowski, Mikail Khona(McGovern Institute for Brain Research), U.J. Kapasi, Steve Dai, Mostofa Patwary, Bita Darvish Rouhani, Jonah Alben, Victor Cui, Ankit Patel, Eric S. Chung, Bryan Catanzaro(Nvidia (United States)), Paulius Micikevicius, Jinhang Choi, Deepak Narayanan(Microsoft Research (India)), O. A. Goncharov, Abhinav Goel, Asit Mishra, Chao Ni, T. Moon, S Venkata Satish Kumar Pasumarthi, Nick Knight, Ben Lanir, Aaron Blakeman, Evan Briones, Felix Abecassis, Carlo del Mundo, Deena Donia, Burc Eryilmaz, Henry Estela, Yugi Guvvala, Robert Hesse, Russell Hewett, Herbert Hum, Anjulie Agrusa, Simon Layton, Michael Lightstone, Abhijit Paithankar, Stefania Alborghetti, Ronny Krashinsky(Vassar College), Sivakumar Arayandi, Dong H. Ahn
Cited by 0
Related Papers
Holistic Evaluation of Language Models
|arXiv (Cornell University)|2022|119
GraphMat: High performance graph analytics made productive
|arXiv (Cornell University)|2015|23
Cosmos World Foundation Model Platform for Physical AI
|arXiv (Cornell University)|2025|9
NVIDIA Nemotron 3: Efficient and Open Intelligence
|arXiv (Cornell University)|2025|1
NVIDIA Nemotron Nano 2: An Accurate and Efficient Hybrid Mamba-Transformer Reasoning Model
|arXiv (Cornell University)|2025|0