塔斯娱乐资讯网

如果主要看本地 AI / Qwen 图像识别,3090 24G 和 5070 Ti 16G 不是简单的“谁快多少”,而是: 5070 Ti 更快更新;3090 能装下更大的模型。 具体看: 项目RTX 3090 24GRTX 5070 Ti 16G谁更强显存24GB16GB3090 +50%显存带宽~936 GB/s~896 GB/s3090略高功耗350W300W5070 Ti架构AmpereBlackwell5070 T ​

如果主要看本地 AI / Qwen 图像识别,3090 24G 和 5070 Ti 16G 不是简单的“谁快多少”,而是:

5070 Ti 更快更新;3090 能装下更大的模型。

具体看:

项目RTX 3090 24GRTX 5070 Ti 16G谁更强显存24GB16GB3090 +50%显存带宽~936 GB/s~896 GB/s3090略高功耗350W300W5070 Ti架构AmpereBlackwell5070 Ti 新很多CUDA/Tensor新特性老新5070 Ti大模型容量明显强容易卡16G墙3090小模型推理快通常更快5070 Ti能效/发热较差更好5070 Ti

在 llama.cpp 的社区同平台 Vulkan 测试里,7B Q4 的生成速度实际上非常接近:

RTX 3090:约 171.6 token/s

RTX 5070 Ti:约 176.2 token/s

也就是 5070 Ti 生成阶段只快大约 3%。

但 Prompt Processing:

3090:约 5201 tok/s

5070 Ti:约 7568 tok/s

5070 Ti 大约快 45%。(GitHub)

所以跑你这种 Qwen3.5-9B Vision,模型全部塞进显存以后,我预计体感是:

5070 Ti ≥ 3090,尤其图片输入、长 Prompt 的预处理阶段,5070 Ti 会明显快一些。

但真正关键的是这个:

16GB 和 24GB 是一道墙

比如粗略举例:

9B Q4大约 5~6GB 权重→ 3090:轻轻松松→ 5070 Ti:轻轻松松

14B Q4约 9GB→ 两张都舒服。

32B Q4通常接近 19~21GB

这时候:

RTX 3090:

24GB → 整个模型可以基本放进 GPU

5070 Ti:

16GB → 放不下 → 部分层扔系统内存/CPU

这时就不是3090慢3%、5070Ti快10%的问题了。

可能直接变成:

3090:流畅 GPU 推理5070 Ti:CPU/GPU混合,速度大幅下降

这就是为什么玩 Local LLM 的人到现在还非常喜欢3090。

实际已经有人在 RTX 3090 24GB 上跑 Qwen3.6-35B-A3B Q6_K,通过部分专家层 CPU offload,生成仍然能达到约 97.7 tok/s。(llamaperf)

对你现在这个需求,我反而更推荐5070 Ti

因为你现在说的核心是:

Qwen3.5-9B + 图像识别

注意你手机的:

16GB RAM ≠ RTX 5070 Ti 的16GB显存。

手机16GB要分给:

Android

系统后台

CPU

GPU

模型

Vision Encoder

KV cache

OpenCL buffer。

最终模型真正能拿到可能远不到16GB。

而5070 Ti:

16GB是专门的VRAM

电脑自己还可以有:

32GB / 64GB DDR5系统内存。

所以你现在手机 16GB跑Qwen3.5-9B Vision爆内存,绝对不能推导出:

“5070 Ti 16GB也跑不了”。

5070 Ti 16GB跑9B视觉模型,容量上一般完全不是一个级别的问题。

如果你的未来需求是:

Qwen3.5-9B Vision

ComfyUI

SDXL / Flux量化

7B/14B LLM

我选:

5070 Ti 16GB

更新、快、功耗低、驱动支持周期长。

但如果你想折腾:

27B / 32B Q4、超长上下文、大视觉模型、视频生成、同时挂多个模型

我宁愿选:

3090 24GB

因为对 AI 来说:

24GB → 16GB 少掉的这8GB,往往比算力差20%还重要。

你可以把它简单理解成:

5070 Ti = 9B/14B 跑得更爽3090 24G = 能跑5070 Ti根本塞不进去的东西

如果二手3090和新5070 Ti价格接近,只为你目前的 Qwen3.5-9B 图像识别,我会买5070 Ti;如果想把桌面机当长期大模型服务器,我会更倾向3090 24G。

by ChatGPT