首页
洛宸

洛宸

Qwen3.6-35B-A3B“越狱版”来了!目前最强“无审查”开源模型?6G 显存都能跑,本地 AI 彻底自由了

Qwen3.6-35B-A3B“越狱版”来了!目前最强“无审查”开源模型?6G 显存都能跑,本地 AI 彻底自由了

项目介绍

最近测试了一圈本地大模型之后,我发现一个非常离谱的东西:目前开源圈里,真正做到中文能力强、推理能力在线、支持视觉多模态、支持 Agent、能本地单卡运行、甚至 6G 显存都能启动、而且还是“无限制”版本的模型,真的不多。

但这次的 Qwen3.6-35B-A3B Uncensored(越狱版) ,确实有点夸张了。

它不是那种“只会胡说八道”的低智商越狱模型。实际测试下来,它的中文理解、代码能力、多模态视觉能力,都属于目前 40B 以内开源模型里的第一梯队

项目相关资源:

核心亮点

  • 超低显存门槛:最低仅需 6G 显存即可本地运行 35B 大模型
  • 无审查限制:完全移除官方内容审查机制,拒绝率从 86/100 降至 5/100
  • 全平台显卡支持:NVIDIA / AMD / Intel 显卡全支持,单卡即可部署
  • 多模态能力:原生支持图像、文本、视频的多模态理解
  • Agent 支持:支持 Hermes、OpenWebUI、Cherry Studio 等 Agent 框架
  • 极致性价比:一张 RTX 4060 Laptop 8G 就能跑出 10 tokens/s

与官方版本对比

对比项 官方 Qwen3.6-35B-A3B 越狱版 (Uncensored)
内容审查 ✅ 有严格限制 ❌ 完全移除
多模态支持
Agent 能力
拒绝率 86/100 5/100
显存要求 较高 6G 起
中文能力 优秀 优秀(第一梯队)

技术架构

模型规格

Qwen3.6-35B-A3B 是一个稀疏混合专家(MoE)模型

  • 总参数量:350 亿
  • 激活参数:仅 30 亿(每 forward pass)
  • 专家数量:256 个专家,每个 token 路由 8 个
  • 架构特点:混合注意力架构(线性注意力 + 全 Softmax 注意力,3:1 比例)
  • 层数:40 层
  • 原生上下文:262K
  • 多模态:原生支持文本、图像、视频

“越狱”原理

越狱版通过 Abliteration(消融术) 技术实现:

Abliterated 模型通过单方向权重正交化,移除了模型中对成人/创意内容的“硬拒绝”反射机制。同时保留了安全护栏(如自残提示仍会导向帮助)。

具体来说,HauhauCS Aggressive 版本实现了 0/465 拒绝率——模型完全解锁,不会拒绝任何提示词。

版本选择指南

越狱版提供多个量化版本,不同显存对应不同选择:

版本 显存要求 适用显卡 特点
IQ2_M 6G~8G RTX 2060 / 3060 Laptop / 4060 Laptop 最低门槛,能跑起来
IQ4_NL(推荐) 12G~16G RTX 4060Ti / 4070 速度-精度-显存最佳平衡
Q4_K_M 16G~24G RTX 4080 / 4090 更稳定,推理更强
Q4_K_P 24G以上 RTX 3090 / 4090 / 5090 效果最好的版本

💡 实测参考:IQ2_M 版本在 RTX 4060 Laptop 8G 上,实测输出速度约 10 tokens/s。对于 35B 这个体量的模型来说,已经相当离谱了。

部署教程

准备工作

  • 一台配备 NVIDIA / AMD / Intel 显卡的 Windows 电脑
  • 至少 6G 显存(推荐 8G 以上)
  • 足够的硬盘空间(模型文件约 10-20G)

方式一:整合包一键部署(推荐)

这是最简单的部署方式,适合绝大多数用户。

第 1 步:下载整合包

访问整合包下载地址:

Qwen3.6-35B-A3B 越狱版整合包https://pan.quark.cn/s/fc4b737a73f1

第 2 步:选择 llama.cpp 运行环境

整合包内包含多个版本的 llama.cpp 运行环境:

文件 适合环境
cuda-13.3-x64 RTX 30/40/50 系显卡,推荐最新 NVIDIA 驱动
cuda-12.4-x64 GTX 10/20 系、部分老驱动环境
cpu-arm64 ARM 架构 CPU(如部分骁龙 Windows 设备)
cpu-x64 普通 Intel/AMD CPU 纯 CPU 运行

根据你的系统环境解压对应版本即可。

第 3 步:准备模型文件

模型目录中包含多个量化版本的 GGUF 文件:

  • Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-f16.gguf(全精度)
  • Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-IQ2_M.gguf(6G 显存可用)
  • Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-IQ4_NL.gguf(推荐)

⚠️ 注意:如需视觉功能,必须下载 mmproj 文件(与主 GGUF 配套)。

第 4 步:运行模型

使用 llama.cpp 运行模型:

llama-cli -m Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-IQ2_M.gguf \
  --mmproj mmproj-Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-f16.gguf \
  --jinja \
  -c 131072 \
  -p "你的提示词"

继续阅读

还没有更多相关文章。

评论

暂时还没有评论,欢迎留下第一条。

发表评论

雁过留声,人过留名