NVIDIA продолжает развивать свою экосистему CUDA, выпустив версию 13.4. Главное новшество — нативная поддержка Windows на Arm64. Ранее разработка CUDA для Arm была доступна только на Linux, теперь же появилась возможность компилировать приложения непосредственно в Windows Arm64. Для существующих систем на x86-64 сохранена кросс-компиляция, что позволяет ориентироваться на Arm-оборудование без смены платформы.
NVIDIA выпустила первые драйверы для RTX Spark — разработчики могут готовить приложения для Windows on Arm уже сейчас
В CUDA 13.4 добавлена предварительная поддержка архитектуры NVIDIA Rubin через вычислительные возможности 10.7. Это даёт разработчикам и мейнтейнерам библиотек возможность начать портирование, компиляцию и тестирование приложений до того, как оборудование Rubin появится в широкой продаже.
Обновление затронуло несколько ключевых областей:
- Компилятор, PTX ISA, CUDA C++ и CUDA Tile — оптимизации и новые возможности.
- API среды выполнения и программные библиотеки — улучшения производительности и совместимости.
- Инструменты разработчика — обновлённые утилиты для профилирования и отладки.
Компонент cuda.core достиг версии 1.1.0. Добавлена поддержка программирования текстур и поверхностей, управляемая память с поддержкой NUMA, а также заглушки типов Python для упрощения разработки. cuda.compute 1.1 получил поддержку предварительной компиляции алгоритмов CCCL для нескольких архитектур GPU.
Multi-Process Service V3 обзавёлся скриптовым интерфейсом командной строки, именованными экземплярами серверов, конфигурацией TOML и интеграцией с cgroup для ограничения памяти GPU. CUDA Compute Fabric Transport добавил именованные логические конечные точки и асинхронные операции для передачи данных между системами, соединёнными через NVLink.
20-ядерный процессор NVIDIA RTX Spark показал неутешительные результаты в многопоточном тесте Cinebench 2026
Ожидается, что CUDA 13.4 также будет поддерживать грядущую платформу NVIDIA RTX Spark. По описанию NVIDIA, это процессор для потребительских ПК, оснащённый 20-ядерным CPU Grace и GPU Blackwell с 6144 ядрами CUDA. Заявленная производительность — до 1 PFLOPS в FP4 для задач ИИ и возможность локальной работы с моделями до 120 миллиардов параметров.
CUDA Toolkit 13.4 уже доступна для загрузки с официального сайта NVIDIA.
