英伟达IFA 2026推动端侧本地AI推理加速
原文:Sparks Fly: NVIDIA Accelerates Local AI at IFA 2026
前沿智能正在走向本地化。在 IFA 2026 上,NVIDIA 与 Microsoft 及其合作伙伴携手合作,提供更快的推理速度和新工具,让智能体更容易在 NVIDIA 硬件上进行本地部署和运行。全新紧凑型 NVIDIA RTX Spark Windows PC 也将于 10 月上市,为 AI 爱好者、开发者和创作者提供更多在本地安全运行强大智能体的方式。今日发布的公告包括:Hermes Agent、OpenClaw 和 Perplexity Portable Computer 将为 NVIDIA GPU 提供简化的本地 AI 支持;本地推理速度最高提升至 1.9 倍——全新的 llama.cpp 和 vLLM 优化现已可直接获取,也可通过 LM Studio 和 Ollama 使用;NVIDIA PAIR——一款个人 AI 路由工具,可智能地将 AI 推理任务分配到用户本地网络中的各台 PC 上;NVIDIA RTX Spark 将于 10 月上市——联想和宏碁将推出全新 Windows PC。Electronic Arts、Embark 和 Ubisoft 等游戏发行商和开发商也加入了最新一批将旗下大作带到 NVIDIA RTX Spark 平台的行列。此外,8 月对本地 AI 来说是忙碌的一个月:Nemotron 3.5 Lightning——可在 NVIDIA RTX PC、RTX PRO 工作站、DGX Spark 和 Jetson 上运行——是一款 300 亿参数的模型,现已正式发布,即刻上手体验 Nemotron 3.5 Lightning。Z.ai 的 GLM-5.3-Flash 是一款多模态混合专家模型,正将智能体 AI 带到 DGX Station。Qwen 发布了 Qwen3.8-Flash-Next——一款开放权重的多模态 MoE 模型,可在 DGX Spark 和 DGX Station 上本地运行;同时还发布了 Qwen3.8-27B——一款 270 亿参数的开放模型,针对 NVIDIA GPU 上的本地智能体和编程工作负载进行了优化。LTX 的 LTX 2.5 是一款针对 NVIDIA RTX GPU、DGX Spark 和 DGX Station 优化的开放世界视频生成模型,新增 NVFP4、FastVideo 和 ComfyUI 增强,可实现更快、更省显存的本地生成。MiniMax-H3 是一款带同步音频的开放权重视频生成模型,可通过 ComfyUI 在 NVIDIA GPU 上本地运行。FastVideo 与 NVIDIA 展开合作。