如果主要看本地 AI / Qwen 图像识别,3090 24G 和 5070 Ti 16G 不是简单的“谁快多少”,而是:
5070 Ti 更快更新;3090 能装下更大的模型。
具体看:
项目RTX 3090 24GRTX 5070 Ti 16G谁更强显存24GB16GB3090 +50%显存带宽~936 GB/s~896 GB/s3090略高功耗350W300W5070 Ti架构AmpereBlackwell5070 Ti 新很多CUDA/Tensor新特性老新5070 Ti大模型容量明显强容易卡16G墙3090小模型推理快通常更快5070 Ti能效/发热较差更好5070 Ti
在 llama.cpp 的社区同平台 Vulkan 测试里,7B Q4 的生成速度实际上非常接近:
RTX 3090:约 171.6 token/s
RTX 5070 Ti:约 176.2 token/s
也就是 5070 Ti 生成阶段只快大约 3%。
但 Prompt Processing:
3090:约 5201 tok/s
5070 Ti:约 7568 tok/s
5070 Ti 大约快 45%。(GitHub)
所以跑你这种 Qwen3.5-9B Vision,模型全部塞进显存以后,我预计体感是:
5070 Ti ≥ 3090,尤其图片输入、长 Prompt 的预处理阶段,5070 Ti 会明显快一些。
但真正关键的是这个:
16GB 和 24GB 是一道墙
比如粗略举例:
9B Q4大约 5~6GB 权重→ 3090:轻轻松松→ 5070 Ti:轻轻松松
14B Q4约 9GB→ 两张都舒服。
32B Q4通常接近 19~21GB
这时候:
RTX 3090:
24GB → 整个模型可以基本放进 GPU
5070 Ti:
16GB → 放不下 → 部分层扔系统内存/CPU
这时就不是3090慢3%、5070Ti快10%的问题了。
可能直接变成:
3090:流畅 GPU 推理5070 Ti:CPU/GPU混合,速度大幅下降
这就是为什么玩 Local LLM 的人到现在还非常喜欢3090。
实际已经有人在 RTX 3090 24GB 上跑 Qwen3.6-35B-A3B Q6_K,通过部分专家层 CPU offload,生成仍然能达到约 97.7 tok/s。(llamaperf)
对你现在这个需求,我反而更推荐5070 Ti
因为你现在说的核心是:
Qwen3.5-9B + 图像识别
注意你手机的:
16GB RAM ≠ RTX 5070 Ti 的16GB显存。
手机16GB要分给:
Android
系统后台
CPU
GPU
模型
Vision Encoder
KV cache
OpenCL buffer。
最终模型真正能拿到可能远不到16GB。
而5070 Ti:
16GB是专门的VRAM
电脑自己还可以有:
32GB / 64GB DDR5系统内存。
所以你现在手机 16GB跑Qwen3.5-9B Vision爆内存,绝对不能推导出:
“5070 Ti 16GB也跑不了”。
5070 Ti 16GB跑9B视觉模型,容量上一般完全不是一个级别的问题。
如果你的未来需求是:
Qwen3.5-9B Vision
ComfyUI
SDXL / Flux量化
7B/14B LLM
我选:
5070 Ti 16GB
更新、快、功耗低、驱动支持周期长。
但如果你想折腾:
27B / 32B Q4、超长上下文、大视觉模型、视频生成、同时挂多个模型
我宁愿选:
3090 24GB
因为对 AI 来说:
24GB → 16GB 少掉的这8GB,往往比算力差20%还重要。
你可以把它简单理解成:
5070 Ti = 9B/14B 跑得更爽3090 24G = 能跑5070 Ti根本塞不进去的东西
如果二手3090和新5070 Ti价格接近,只为你目前的 Qwen3.5-9B 图像识别,我会买5070 Ti;如果想把桌面机当长期大模型服务器,我会更倾向3090 24G。
by ChatGPT