Qwen3.6-35B-A3B“越狱版”来了!目前最强“无审查”开源模型?6G 显存都能跑,本地 AI 彻底自由了
Qwen3.6-35B-A3B“越狱版”来了!目前最强“无审查”开源模型?6G 显存都能跑,本地 AI 彻底自由了
项目介绍
最近测试了一圈本地大模型之后,我发现一个非常离谱的东西:目前开源圈里,真正做到中文能力强、推理能力在线、支持视觉多模态、支持 Agent、能本地单卡运行、甚至 6G 显存都能启动、而且还是“无限制”版本的模型,真的不多。
但这次的 Qwen3.6-35B-A3B Uncensored(越狱版) ,确实有点夸张了。
它不是那种“只会胡说八道”的低智商越狱模型。实际测试下来,它的中文理解、代码能力、多模态视觉能力,都属于目前 40B 以内开源模型里的第一梯队。
项目相关资源:
- 官方基础模型:Qwen/Qwen3.6-35B-A3B
- 越狱版整合包:https://pan.quark.cn/s/fc4b737a73f1
- HuggingFace 模型页:CCSSNE/HauhauCS-Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
- 开源协议:Apache-2.0
核心亮点
- 超低显存门槛:最低仅需 6G 显存即可本地运行 35B 大模型
- 无审查限制:完全移除官方内容审查机制,拒绝率从 86/100 降至 5/100
- 全平台显卡支持:NVIDIA / AMD / Intel 显卡全支持,单卡即可部署
- 多模态能力:原生支持图像、文本、视频的多模态理解
- Agent 支持:支持 Hermes、OpenWebUI、Cherry Studio 等 Agent 框架
- 极致性价比:一张 RTX 4060 Laptop 8G 就能跑出 10 tokens/s
与官方版本对比
| 对比项 | 官方 Qwen3.6-35B-A3B | 越狱版 (Uncensored) |
|---|---|---|
| 内容审查 | ✅ 有严格限制 | ❌ 完全移除 |
| 多模态支持 | ✅ | ✅ |
| Agent 能力 | ✅ | ✅ |
| 拒绝率 | 86/100 | 5/100 |
| 显存要求 | 较高 | 6G 起 |
| 中文能力 | 优秀 | 优秀(第一梯队) |
技术架构
模型规格
Qwen3.6-35B-A3B 是一个稀疏混合专家(MoE)模型:
- 总参数量:350 亿
- 激活参数:仅 30 亿(每 forward pass)
- 专家数量:256 个专家,每个 token 路由 8 个
- 架构特点:混合注意力架构(线性注意力 + 全 Softmax 注意力,3:1 比例)
- 层数:40 层
- 原生上下文:262K
- 多模态:原生支持文本、图像、视频
“越狱”原理
越狱版通过 Abliteration(消融术) 技术实现:
Abliterated 模型通过单方向权重正交化,移除了模型中对成人/创意内容的“硬拒绝”反射机制。同时保留了安全护栏(如自残提示仍会导向帮助)。
具体来说,HauhauCS Aggressive 版本实现了 0/465 拒绝率——模型完全解锁,不会拒绝任何提示词。
版本选择指南
越狱版提供多个量化版本,不同显存对应不同选择:
| 版本 | 显存要求 | 适用显卡 | 特点 |
|---|---|---|---|
| IQ2_M | 6G~8G | RTX 2060 / 3060 Laptop / 4060 Laptop | 最低门槛,能跑起来 |
| IQ4_NL(推荐) | 12G~16G | RTX 4060Ti / 4070 | 速度-精度-显存最佳平衡 |
| Q4_K_M | 16G~24G | RTX 4080 / 4090 | 更稳定,推理更强 |
| Q4_K_P | 24G以上 | RTX 3090 / 4090 / 5090 | 效果最好的版本 |
💡 实测参考:IQ2_M 版本在 RTX 4060 Laptop 8G 上,实测输出速度约 10 tokens/s。对于 35B 这个体量的模型来说,已经相当离谱了。
部署教程
准备工作
- 一台配备 NVIDIA / AMD / Intel 显卡的 Windows 电脑
- 至少 6G 显存(推荐 8G 以上)
- 足够的硬盘空间(模型文件约 10-20G)
方式一:整合包一键部署(推荐)
这是最简单的部署方式,适合绝大多数用户。
第 1 步:下载整合包
访问整合包下载地址:
Qwen3.6-35B-A3B 越狱版整合包:https://pan.quark.cn/s/fc4b737a73f1
第 2 步:选择 llama.cpp 运行环境
整合包内包含多个版本的 llama.cpp 运行环境:
| 文件 | 适合环境 |
|---|---|
cuda-13.3-x64 |
RTX 30/40/50 系显卡,推荐最新 NVIDIA 驱动 |
cuda-12.4-x64 |
GTX 10/20 系、部分老驱动环境 |
cpu-arm64 |
ARM 架构 CPU(如部分骁龙 Windows 设备) |
cpu-x64 |
普通 Intel/AMD CPU 纯 CPU 运行 |
根据你的系统环境解压对应版本即可。
第 3 步:准备模型文件
模型目录中包含多个量化版本的 GGUF 文件:
Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-f16.gguf(全精度)Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-IQ2_M.gguf(6G 显存可用)Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-IQ4_NL.gguf(推荐)
⚠️ 注意:如需视觉功能,必须下载
mmproj文件(与主 GGUF 配套)。
第 4 步:运行模型
使用 llama.cpp 运行模型:
llama-cli -m Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-IQ2_M.gguf \
--mmproj mmproj-Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-f16.gguf \
--jinja \
-c 131072 \
-p "你的提示词"