---
title: 【Paper&amp;Hacks vol.95】LLMの量子化〜LLMを民主化する技術〜
tags: 
author: [松尾研LLMコミュニティ](https://image.docswell.com/user/matsuo-lab_llm)
site: [Docswell](https://www.docswell.com/)
thumbnail: https://bcdn.docswell.com/page/YJ9P1L3R73.jpg?width=480
description: 本イベントは、原則毎週火曜日20:00から松尾・岩澤研究室 LLMコミュニティが主催するLLMに関する輪読会 &amp; 実装のオンラインイベントです。  【アーカイブはこちら】 https://x.gd/Ln7n6  【イベント概要】 対象: 普段から論文を読んでいる/普段からLLMの実装を行なっている方々  レベル: ★★★★☆　(Expert)  発表者:井伊篤彦（異業種データサイエンス研究会®️代表）  タイトル: 『LLMの量子化〜LLMを民主化する技術〜』  発表カテゴリ:   バランス型（理論と実践のちょうど中間くらい）  イベント内容：LLMを低GPUメモリ環境で実行するための種々の量子化技術を解説します。4bit量子化と最新のbonsaiモデルを実装したRAGアプリをデモし、セミナー中にコードを配布します。  扱う論文： https://arxiv.org/abs/2305.14314 https://github.com/PrismML-Eng/Bonsai-demo/blob/main/bonsai-27b-whitepaper.pdf  【松尾研LLMコミュニティについて】 松尾研LLMコミュニティは、「大規模言語モデルについて知って学べるオンライン空間」として、東京大学松尾・岩澤研究室が運営するコミュニティです。現在、学生を中心とした16,000名以上が、原則無償で参加しています。  ※ 現在、松尾研LLMコミュニティへの新規参加申込み受付を停止しております。  ーーー  【松尾研大規模言語モデル講座開講のお知らせ】  昨年大好評だった松尾研大規模言語モデル講座を今年も完全オンラインにて開講いたします！ 今年は内容をグレードアップし、大規模言語モデル1,2,3の3段階構成でお送りすることになりました。 生成AIの基盤技術である大規模言語モデル（LLM）の原理からアーキテクチャーまで取り扱う実践的な講義となっております。座学のみならず演習を通して、手を動かしながら技術を深く理解し、幅広いトピックを網羅します。  詳細は以下のURLからご覧ください！ 大規模言語モデル1：https://x.gd/Dy8yg  ※事前に受講申込が必須 ※参加対象者やその他条件がございますので、必ずHPをご確認下さい。
published: August 25, 26
canonical: https://image.docswell.com/s/matsuo-lab_llm/5Y87P4-Paper&amp;HacksVol.96
---
# Page. 1

![Page Image](https://bcdn.docswell.com/page/YJ9P1L3R73.jpg)



# Page. 2

![Page Image](https://bcdn.docswell.com/page/GJ8D4XMGJD.jpg)

（RAG セミナー１期と２期の橋渡し）
LLM の量子化
〜 LLMを民主化する技術 〜
2026/8/25異業種データサイエンス研
究会 ® 代表井伊 篤彦


# Page. 3

![Page Image](https://bcdn.docswell.com/page/LJLM683XER.jpg)

井伊篤彦
Who am I?
1963年（昭 38年）生まれ。京都大学工学部修士課程（合成化学専攻）修了。大学
和
院で量子化学を副専攻。
前職は一部上場大手日用品製造メーカー研究所。社内で各種製品開発を行うかた
わらコンピューターケミストリーを手掛け、化学分子 3D表示ソフト等をC言語を用い
て開発。
その後、海外駐在やグローバルな商品開発マネージャーを経て、2017年からAI及
びxR (VR, AR, MR) を用いた新規プロジェクトをゼロから立ち上げ率いた。AIプロ
ジェクトでは、自ら機械学習モデルを開発した。
2019年に FBコミュニティ「異業種データサイエンス研究会
16個のFBコミュニティ を運営してい
®」を立ち上げる。現在
る。
プログラミングスクールで AIプログラミングの指導 をする傍ら、
年間数十回のデータサイエンス・ AI関連の セミナーを実施 している。


# Page. 4

![Page Image](https://bcdn.docswell.com/page/47MY56D37W.jpg)

10回シリーズ： RAG の基礎から実践まで
第一部 基礎編：RAGの仕組みを理解して改善し続けよう
1回目
作る
動いて中身も見える
RAGアプリ
・Retriever / Prompt / LLM
・ログ run_id）保存
・Gradioで体験
（
2回目
測る
Ragas × LangSmith
・検索と生成を分解
・Faithfulness / Relevance
・悪い例を追跡
3回目
4回目
5回目
鍛える
自律化
chunk &amp; prompt 戦略 /
Adv. RAG
Embedding比較 &amp; LLM
RAG最適化
LangGraph / Agentic
RAG
改善する
・chunk_size / overlap
・当たりチャンク探索
・改善の再現性
・Embedding設計
・FTで生成品質向上
・評価結果を再利用
・検索 / 推論 / 生成
・ループで精度改善
・運用に近い形へ
第二部 実践編：現場で扱うための拡張と運用
GPU 効率利用
LLM 量子化
6回目
DBを整える
図表を含むドキュ
メントの前処理
7回目
8回目
関係を知る
目をもつ
Graph RAG
VLM RAG
9回目
運用
MLOpsを組み込んだ実
用的なRAGｼｽﾃﾑ


# Page. 5

![Page Image](https://bcdn.docswell.com/page/P7R93P4RE9.jpg)

10回シリーズ：RAG の基礎から実践まで
第一部 基礎編：RAGの仕組みを理解して改善し続けよう
1回目
2回目
作る
測る
動いて中身も見える
RAGアプリ
導
・Retriever / Prompt / LLM
入Ragas ×
・Faithfulness
/ Relevance
・検索と生成を分解
・ログ run_id）保存 LangSmith
・
悪い例を追跡
・Gradioで体験
（
3回目
改善する
chunk &amp; prompt 戦略 /
Advanced RAG
4回目
選択
タスクに応じた
generator 選択 / API
利
用
・Embedding選択
・API利用
ソリューション
・chunk_size / overlap
・当たりチャンク探索
・改善の再現性
・モデルサイズ選択
5回目
自律化
LangGraph / Agentic
RAG技術紹介
・検索 / 推論 / 生成
・ループで精度改善
・運用に近い形へ
第二部 実践編：現場で扱うための拡張と運用
GPU 効率利用
LLM 量子化
6回目
評価と基盤固め
評価法／検索システム
ソリューション（9
月予定）／データ前処理
7回目
目をもつ
8回目
関係を知る
VLM RAG技術紹介（Graph
11月予定）
RAG
（10月予
定）
9回目
運用
MLOpsを組み込んだ実
実運用
用的な
RAG
ｼｽﾃﾑ
（12月予定）


# Page. 6

![Page Image](https://bcdn.docswell.com/page/PJXQ432Y7X.jpg)

Agenda
1. 主要な量子化技術の整理
2. QLoRAと4bit量子化
3. Unslothによる高速・省メモリ化
4. Bonsai 27Bの1bit・三値量子化
5. 1bit LLMの位置づけと総合比較


# Page. 7

![Page Image](https://bcdn.docswell.com/page/3JK9ZYM4JD.jpg)

Agenda
1. 主要な量子化技術の整理
2. QLoRAと4bit量子化
3. Unslothによる高速・省メモリ化
4. Bonsai 27Bの1bit・三値量子化
5. 1bit LLMの位置づけと総合比較


# Page. 8

![Page Image](https://bcdn.docswell.com/page/LE3WD9YDE5.jpg)

主要な量子化技術の整理
8 月 LLM 量子化セミナー：使ったことのある精度・量子化方式を、用途と注意点で一枚に圧縮
量子化は「ビット数」だけでなく、スケール係数・ローダー対応・GPU 世代で実用性が決まる。
方式
BF16
精度
主な狙い
強み
注意点 / 実務メモ
対応 GPU が必要。T4 では BF16 Conv3D などが詰まる場
16bit
品質・安定性の基準
指数部が広く、学習・推論で安定しやすい
FP16
16bit
高速推論・標準運用
対応が広く、画像・動画生成で扱いやすい
BF16 より数値範囲は狭い。困った時の実用的な避難先
FP8
8bit
VRAM/RAM 削減
重みを軽くでき、14B 級モデル運用の選択肢に
非 Scaled 型なら既存ローダーで通ることがある。GPU/
なる
実装依存
FP8-Scaled
8bit + scale
FP8 の精度補正
scale 係数で重みの大きさを復元し、劣化を抑
Scale 対応ローダー が必須。ComfyUI では未対応ノード
えやすい
では読み込み拒否される
Mixed FP8
混合
品質と軽量化の折衷
NF4
4bit
LLM の超省メモリ
(bﬂoat16)
重要層は BF16/FP16、重い層は FP8 などに分
けられる
合あり
「全部同じ精度」ではないため、構成・ログ確認が重要
QLoRA 系で有名。低 VRAM で LLM を扱いや
主に LLM 向け。動画生成モデルでは FP 系量子化とは別
すい
文脈
※ BF16 / FP16 は厳密には量子化ではなく、比較基準となる低精度表現。ここでは実務上の「軽量化・精度選択」として同じ表に整理。


# Page. 9

![Page Image](https://bcdn.docswell.com/page/8EDKPG527G.jpg)

FP8 Scaledモデルとは何か
量子化値だけでなく、復元用のスケール係数も持つ FP8形式
元の重み
W
FP8量子化値 Q
= FP8(W/S)
Scale係数
S
計算時に復元
W≈Q×
S
非scaled FP8
FP8化した重みを、そのまま読む。
ローダー側の処理は比較的単純。
Scaled FP8
FP8重み ＋ Scale係数を組み合わせて読む。
FP8の狭い数値範囲を補正しやすい。
注意点
Scaled形式は「専用ローダー」が必要。
重みだけを読む実装では、
Scale係数を正しく扱えない。


# Page. 10

![Page Image](https://bcdn.docswell.com/page/V7PKN3GLJ8.jpg)

Mixed FP8 とは何か
すべてを FP8 にせず、重み・演算・出力で精度を使い分ける方式
元のモデル
BF16 /
FP16
16bit で残
す重要部分
FP8 化する部分
重み・行列演算
出力・蓄積
FP16 /
BF16
非 Mixed FP8
同じ方式で広く FP8 化する。
単純だが、誤差や非対応演算が問題になる。
Mixed FP8
注意点
重い行列演算や重みは FP8 化。
「Mixed」の中身は実装ごとに違う。
LayerNorm、Softmax、
出力などは 16bit で残す。
E4M3/E5M2 の混在、FP8＋FP16/BF16 の混在など、
ノード・GPU・ローダー対応を確認する必要がある。
LLM 量子化セミナー用


# Page. 11

![Page Image](https://bcdn.docswell.com/page/2JVVK466JQ.jpg)

Agenda
1. 主要な量子化技術の整理
2. QLoRAと4bit量子化
3. Unslothによる高速・省メモリ化
4. Bonsai 27Bの1bit・三値量子化
5. 1bit LLMの位置づけと総合比較


# Page. 12

![Page Image](https://bcdn.docswell.com/page/5EGLQ1N2JL.jpg)

QLORA: Efficient Finetuning of Quantized LLMs
https://arxiv.org/abs/2305.14314
Abstract
We present QLORA, an efficient finetuning approach that reduces memory usage enough to finetune a 65B parameter
model on a single 48GB GPU while preserving full 16-bit finetuning task performance. QLORA backpropagates
gradients through a frozen, 4-bit quantized pretrained language model into Low Rank Adapters (LoRA). Our best model
family, which we name Guanaco, outperforms all previous openly released models on the Vicuna benchmark, reaching
99.3% of the performance level of ChatGPT while only requiring 24 hours of finetuning on a single GPU. QLORA
introduces a number of innovations to save memory without sacrificing performance: (a) 4-bit NormalFloat (NF4), a new
data type that is information theoretically optimal for normally distributed weights (b) Double Quantization to reduce the
average memory footprint by quantizing the quantization constants, and (c) Paged Optimizers to manage memory
spikes. We use QLORA to finetune more than 1,000 models, providing a detailed analysis of instruction following and
chatbot performance across 8 instruction datasets, multiple model types (LLaMA, T5), and model scales that would be
infeasible to run with regular finetuning (e.g. 33B and 65B parameter models). Our results show that QLoRA finetuning
on a small high-quality dataset leads to state-of-the-art results, even when using smaller models than the previous
SoTA. We provide a detailed analysis of chatbot performance based on both human and GPT-4 evaluations showing
that GPT-4 evaluations are a cheap and reasonable alternative to human evaluation. Furthermore, we find that current
chatbot benchmarks are not trustworthy to accurately evaluate the performance levels of chatbots. A lemon-picked
analysis demonstrates where Guanaco fails compared to ChatGPT. We release all of our models and code, including
CUDA kernels for 4-bit training.


# Page. 13

![Page Image](https://bcdn.docswell.com/page/4JQYKDQ97P.jpg)

Abstract
本論文では、QLORA を提案する。これは、完全な16ビットのファインチューニング時のタスク性能を保ったまま 、メモリ使用量を大幅に効率的な
削減し、単一の48GB GPU上で650億パラメータのモデルをファインチューニング可能にする
た4ビット量子化済み事前学習言語モデル を通して勾配を逆伝播させ、Low Rank Adapters（LoRA）を学習する。私たちの最良のモ
デル系列 Guanaco は、Vicuna ベンチマークにおいて、これまでに公開されているすべてのモデルを上回り、ChatGPT の性能の
99.3% に到達した。しかも、単一GPUで24時間のファインチューニング しか必要としない。
QLORA は、性能を犠牲にせずにメモリを節約するため、いくつかの新規性を導入している。
(a) 4-bit NormalFloat（NF4）：正規分布に従う重みに対して、情報理論的に最適な新しいデータ型。
(b) Double Quantization：量子化定数自体も量子化することで、平均メモリ使用量をさらに削減する手法。
(c) Paged Optimizers：メモリ使用量の急増を管理する仕組み。
私たちは QLORA を用いて 1000以上のモデルをファインチューニングし、8種類の instruction データセット、複数のモデル種別
T5）、そして通常のファインチューニングでは実行不可能な規模のモデル（たとえば 330億・650億パラメータモデル）にわたっ
（LLaMA、
て、instruction-following 能力とチャットボット性能を詳細に分析した。その結果、小規模だが高品質なデータセットで QLoRA によるファ
インチューニングを行うと、従来の最先端手法より小さいモデルを使っていても、最先端性能が得られる ことが分かった。
また、人手評価と GPT-4 評価の両方に基づいてチャットボット性能を詳しく分析し、GPT-4 による評価は、人手評価に対する安価で妥当な
代替手段であることを示した。さらに、現在のチャットボット用ベンチマークは、チャットボットの性能を正確に評価するには信頼しきれな
いことも分かった。加えて、意図的に失敗例を選んだ分析により、Guanaco が ChatGPT に比べてどこで失敗するのか を示した。私たちは、
4ビット学習のための CUDA カーネルを含む、すべてのモデルとコードを公開する 。


# Page. 14

![Page Image](https://bcdn.docswell.com/page/K74WPZYRE1.jpg)

INT4 = Integer 4-bit
4ビット整数の量子化です。
NF4 = NormalFloat 4-bit
4ビットの NormalFloat です。
ここでの N は Normal、F は Float です。


# Page. 15

![Page Image](https://bcdn.docswell.com/page/LJ1Y9R6VEG.jpg)

INT4 vs NF4
等間隔
中央に密集


# Page. 16

![Page Image](https://bcdn.docswell.com/page/GJWGQ1W372.jpg)

Unsloth：LLM / VLM 高速・省メモリ化ライブラリ
https://github.com/unslothai/unsloth
特徴
● 高速推論・低メモリ（ 4bit / 8bit 量子化対応）
：推論約２倍、メモリ使用量約 70%削減
● LoRA / QLoRA による効率的学習
● Hugging Face / LangChain と互換
対応モデル
モデル
Hugging
VRA
Unsloth
VRAM 削
長いコンテキ
M
速度
減
スト
2x
&gt;75%
13 倍長い
1x
2x
&gt;70%
12 倍長い
1x
Face +
● LLaMA系・Mistral・Qwen・Mixtral・
Vision-Language Models 等
主な用途
●
手元GPUでの大規模モデル実行
●
省メモリ本番推論
●
ドメイン特化モデルの短期学習
Llama
3.3
(70B)
Llama
3.1
(8B)
80
GB
80
GB
ベンチマーク：
FA2*
* FA2: Flash Attention 2
https://qiita.com/yonaka15/items/b1f3b3133614a063c5c5


# Page. 17

![Page Image](https://bcdn.docswell.com/page/4EZLWP5G73.jpg)

Agenda
1. 主要な量子化技術の整理
2. QLoRAと4bit量子化
3. Unslothによる高速・省メモリ化
4. Bonsai 27Bの1bit・三値量子化
5. 1bit LLMの位置づけと総合比較


# Page. 18

![Page Image](https://bcdn.docswell.com/page/Y76WGM9Q7V.jpg)

なぜ Unsloth は GPU 使用効率が高いのか
量子化だけでなく、計算のしかたとメモリの使い方を軽くしている
普通の Hugging Face
Unsloth
/Transformers
① 4bitでも
演算は重い
② 中間データ
を何度も作る
③ activation
が途中で膨らむ
① 4bit / QLoRA
を前提に軽量化
② Triton
kernel でま
とめて計算
③ fused /
backprop
よく起きること
効いていること
• 読み出し・書き戻しが多い
• 一時データが膨らみやすい
• 長い文脈や大きい batch を取りにくい
• 計算経路を短くする
• 読み出し・書き戻しを減らす
• 一時データをできるだけ持たない
VRAM の使われ方
重み
最適化
イメージ
計算
バッファ
= メモリを使う場所が多い
中間
データ
重み
fused kernel で
まとめて処理
= 一時データ量を抑えやすい
モデルを小さくしただけでなく、GPU が行き来するムダな仕事も減らしている。


# Page. 19

![Page Image](https://bcdn.docswell.com/page/G75MVZN274.jpg)

Qwen3 4B RAGアプリ GPU メモリ消費量
Generator / Embeddingモデルロード直後
HuggingFace
HuggingFace /
4bit 量子化
unsloth
unsloth /
4bit 量子化
RAG実行後


# Page. 20

![Page Image](https://bcdn.docswell.com/page/9J293R51ER.jpg)

Agenda
1. 主要な量子化技術の整理
2. QLoRAと4bit量子化
3. Unslothによる高速・省メモリ化
4. Bonsai 27Bの1bit・三値量子化
5. 1bit LLMの位置づけと総合比較


# Page. 21

![Page Image](https://bcdn.docswell.com/page/DEY41DK4JM.jpg)

Bonsai 27B White Paper
https://github.com/PrismML-Eng/Bonsai-demo/blob/main/bonsai-27b-whitepaper.pdf
Executive Summary 要約
本ホワイトペーパーでは、「Qwen3.6-27B」を基盤とする低ビット言語モデル「Bonsai 27B」を提案する。27B級モデルは、多段
階推論、ツール利用、エージェント処理を実用水準で実行できる一方、従来方式では、性能を維持するとモデルが大きすぎ、4〜5ビッ
ト未満まで圧縮すると推論やツール呼び出しが不安定になるという課題があった。
Bonsai 27Bは、モデル全体を二値または三値表現へ変換 し、2ビット未満でも27B級の思考・推論・エージェント能力を維持する
ことを目指す。約75％を線形Attentionが占めるハイブリッド構成と4ビットKVキャッシュ量子化により、最大262Kトークンの長い
コンテキストにも対応 する。
(a) Ternary Bonsai 27B：重みを−1、0、＋1で表現する。実効1.71bit／weight、約5.9GBで、FP16比約9.4倍に圧縮し、15ベ
FP16性能の約95％を維持する。
ンチマーク平均80.49、
(b) 1-bit Bonsai 27B：重みを−1、＋1で表現する。実効1.125bit／weight、約3.9GBで、FP16比約14.2倍に圧縮し、平均
76.11、FP16性能の約90％を維持する。
FP16版は54GB、従来の低ビット版IQ2_XXSは9.4GBであるのに対し、Bonsaiはさらに小さいサイズで高い性能を保つ。三値版は
ノート PC、
1-bit版はハイエンドスマートフォンで動作 し、従来はクラウドや高性能GPUが必要だった27B級モデルのエッジ実行を
可能にする。


# Page. 22

![Page Image](https://bcdn.docswell.com/page/VJNY26R678.jpg)

Bonsai 27B：1bit／三値量子化モデル
Qwen3.6-27Bを、専用形式・専用カーネルで極低ビット化して使う最新事例
4bit量子化の先にある「1bit／1.58bit」—— 27BモデルをRAGアプリで実測する。
元モデル
Qwen3.6
27B
専用形式で読む
GGUF＋llama.cpp
PrismML系カーネル
極低ビット化
1bit／三値
RAGアプリで検証
メモリ・速度・品質
Bonsai 27B 1bit
Bonsai 27B 1.58bit（三値）
実効約1.125 bit/weight
1bit
三値量子化
約1.58bit
主な狙い
最小メモリ・軽量実行
品質重視・4bit未満
公式目安
約3.9GB
元モデル評価 89.5%
約7.2GB
元モデル評価 94.6%
実装上の要点
FP16へ展開しない。
1bit重みを低ビットのまま処理する。
通常の4bit量子化とは別系統。
専用ローダー・カーネル対応を確認する。
セミナーでの役割
「27Bでもここまで軽くなる」ことを示す。
低ビット化と品質維持の折衷点を示す。
項目
量子化
注意点
日本語入出力は可能。
日本語品質維持率は実測で見る。
総合評価値を、日本語品質だけの値と混同しない。
「小さいファイル」ではなく、低ビット重みをそのまま計算するための実行技術として扱う。
LLM量子化セミナー用


# Page. 23

![Page Image](https://bcdn.docswell.com/page/YE9P1LMRJ3.jpg)



# Page. 24

![Page Image](https://bcdn.docswell.com/page/GE8D4XLGED.jpg)



# Page. 25

![Page Image](https://bcdn.docswell.com/page/LELM68LX7R.jpg)

Qwen3 4B vs bonsai 27B RAGアプリ GPU メモリ消費量
Generator / Embeddingモデルロード直後
Qwen3 4B
Qwen3 4B
4bit 量子化
Bonsai 27B
1bit
Bonsai 27B
Ternary
RAG実行後


# Page. 26

![Page Image](https://bcdn.docswell.com/page/4JMY56M3JW.jpg)

魔法科高校 15問 一覧
Q番号・質問・正答・問題タイプ｜検索・列挙・統合・取り違えを観察するための小型ベンチマーク
Q
質問
Q1 「魔法科高校の劣等生」のキャラクター司波深雪の声優は誰ですか？
正答
問題タイプ
早見沙織
単純事実確認
Q2
九島家の説明では司波深雪に匹敵する魔法力を持つとされ、別の記述では十三使徒「ア
ンジー・シリウス」と呼ばれる人物は誰ですか？
アンジェリーナ・クドウ・シールズ（リーナ）。
人物・属性対応（同一人物特定）
Q3
十三束鋼の二つ名「 Range Zero（レンジ・ゼロ）
」には、どのような二つの意味が込めら
れていますか？
遠隔魔法が苦手だという揶揄と、ゼロ距離では無類の強さを発揮する
という敬意の二つの意味が込められている。
複数要素説明（二面性理解）
身長177cm、体重67kg
単純事実確認
Q4 「魔法科高校の劣等生」のキャラクター九重八雲の身長と体重を教えて。
Q5
「魔法科高校の劣等生」で、司波達也と九島光宣はどちらも「精霊の眼（エレメンタル・サ
イト）
」を持っています。2人の知覚の得意分野はそれぞれ何ですか？
司波達也は分解・再成の特性から能動的な知覚に優れ、九島光宣は仮装行列（パレード）
の特性から受動的な知覚に優れ、意識を向けていない状態でも遠方の魔法の兆候を感 人物・属性対応（比較）
じ取れる。
Q6
「魔法科高校の劣等生」の中で「水晶眼」を持つキャラクターは以下の３人のうち誰でしょうか？
1. 司波深雪
2. 千葉エリカ
3. 柴田美月
柴田美月
Q7
吉祥寺真紅郎の異名「カーディナル・ジョージ」は、どの二つの要素に由来しています
か？また、彼がそれを活かして使う代表的な魔法は何ですか？
仮説上の存在だった「基本（カーディナル）コード」の発見と、名前の「真紅（カーデ
複数要素列挙（異名の由来）
ィナルレッド）
」に由来する。代表的な魔法は「不可視の弾丸（インビジブル・ブリット）」。
Q8
一条将輝の戦略級魔法「海爆（オーシャン・ブラスト）
」は、どの技術を基幹にし、誰が
完成させたものですか？
達也から提供されたトゥマーン・ボンバの基幹技術「チェイン・キャ
スト」を基に、吉祥寺真紅郎が完成させた。
技術・人物対応
カーラ・シュミットとウィリアム・マクロード
複数正答列挙
Q9 「魔法科高校の劣等生」に出てくる戦略級魔法「オゾンサークル」は誰の魔法ですか？
単純事実確認（選択式）
Q10
各ファイルの記述に従うと、日本の国家公認戦略級魔法師について、五輪澪はどのような
立場で記されており、一条将輝は何人目として認定されましたか？
五輪澪は「日本が公式に認定している唯一の戦略級魔法師」と記されて
おり、一条将輝は「日本で二人目の国家公認戦略級魔法師」として認定
された。
複数ファイル記述比較
Q11
「魔法科高校の劣等生」のキャラクター牛山欣治は社内で司波達也が「ミスター・シル
バー」と呼ばれるのに対し、どのように呼ばれていますか？
ミスター・トーラス
単純事実確認
Q12
『メイジアン・カンパニー』において、司波達也が設立した三つの組織・法人の名前をす
べて挙げてください。
「メイジアン・ソサエティ」「ステラ・ジェレネーター」
「一般社団法人
メイジアン・カンパニー」。
組織名列挙
「魔法科高校の劣等生」の中条あずさが持つ系統外魔法「梓弓」は、どのようなタイプの
情動干渉系の系統外魔法で、一定のエリア内にいる人間をある種のトランス状態に誘
導する。個人ではなくエリアに働きかける稀少な魔法で、無秩序な混乱の鎮圧に適し 説明型（魔法の性質・用途）
ている。
Q13
魔法で、どのような状況に適していますか？
Q14
一色家の固有魔法「神経電流撹乱（神経撹乱）
」について、一条家では誰が使えず、誰が
その適性を受け継いでいますか？
一条美登里は使えず、長女の一条茜がその適性を受け継いでいる。
人物関係対応（家系継承）
Q15
「トーラス・シルバー」に関して、司波達也がその名で製品を世に送り出す際に組んでい
る人物と、その正体を確信した第一高校の生徒をそれぞれ答えてください。
組んでいる人物は牛山欣治で、正体を確信した第一高校の生徒は中条あ
ずさ。
複合文脈統合


# Page. 27

![Page Image](https://bcdn.docswell.com/page/PJR93PVR79.jpg)

Bonsai 27B：RAG回答比較例（ 1bit vs Ternary）
同一質問・同一模範解答・統一評価基準で比較
質問
吉祥寺真紅郎の異名「カーディナル・ジョージ」は、どの二つの要素に由来？代表魔法は？
模範
解答
基本（カーディナル）コードの発見＋ 名前の真紅（カーディナルレッド）
代表魔法：不可視の弾丸（インビジブル・ブリット）
評価基準：内容一致 3点 ／ 根拠への忠実性 1点 ／ 表現の正確性 1点
1bit 回答と評価
Ternary 回答と評価
回答：由来＝将輝からの渾名＋基本コード「真紅」
魔法＝不可視の弾丸（インビジブル・ブリット）
回答：由来＝基本コード＋名前の真紅
魔法＝不可視の弾弾（インビジブル・ブリット）
2.5／5点
4.5／5点
差が出た理由
評価ポイント
評価：魔法名は正解。しかし「ジョージの渾名」を由来
と誤解し、基本コードと真紅を誤結合。
1bit：検索根拠が不足し、取得断片の意味関係を作り替
えた。
評価：中心要素を取得し、根拠にも忠実。「弾弾」は元
文書側の表記差として扱う。
Ternary：正しい根拠を取得し、回答も根拠の意味関係に沿った。
流暢な回答よりも、検索根拠の適合性と、根拠内の意味関係を正しく保てるかが重要。
結論：今回の比較では Ternary 版が優位。
1bit版は文章は自然だが由来を誤結合。Ternary版は表記差が残るが、質問の核心と根拠の意味が一
致。
LLM量子化セミナー用


# Page. 28

![Page Image](https://bcdn.docswell.com/page/PEXQ43ZYJX.jpg)

Agenda
1. 主要な量子化技術の整理
2. QLoRAと4bit量子化
3. Unslothによる高速・省メモリ化
4. Bonsai 27Bの1bit・三値量子化
5. 1bit LLMの位置づけと総合比較


# Page. 29

![Page Image](https://bcdn.docswell.com/page/3EK9ZY84ED.jpg)

Microsoft BitNet と Bonsai 27B の比較
「最初から低ビットで学習する」BitNet ／「既存27Bを低ビット化して動かす」
Bonsai
1bit LLMは、研究上のアイデアから「実機で動く低ビット実行技術」へ進んだ。
項目
作り方
BitNet b1.58
Bonsai 27B
Microsoft Research
1.58bit LLMの学習レシピ
PrismML / Caltech系
既存Qwen3.6-27Bを1bit・三値で実行
Microsoft BitNet b1.58
Bonsai 27B
BitLinearを使い、
Qwen3.6-27Bの
最初から低ビット前提で学習
重み表現を二値・三値へ変換
三値 {−1, 0, +1}
約1.58bit、活性化は8bit
Binary：1.125bit/weight
Ternary：1.71bit/weight
1bit LLMの設計思想・
スケーリング則を示す
既存27BをローカルRAGで
実測・デモできる
制約
既存FP16モデルを
そのまま低ビット化する話ではない
中核変換は非公開技術。
専用ローダー・カーネルが必要
位置づけ
「1bit LLMの入口」
「1bit LLMの実装到達点」
重み表現
強み
整理：BitNet = 低ビット LLMを最初から作る技術 ／ Bonsai = 既存の強い LLMを低ビットで動かす技術
LLM量子化セミナー用


# Page. 30

![Page Image](https://bcdn.docswell.com/page/L73WD92D75.jpg)

まとめ：6種類のRAGアプリで比較する位置づけ
同じRAGアプリ構成で Generator だけを差し替え、量子化の意味を実測で見る
比較軸は「GPUメモリ」「推論速度」「回答品質」—— Bonsaiは27B級モデル
Qwen3 4B 系
RAG実行後 GPU RAM（Colab T4 / 15.0GB）
01
Unsloth / Qwen3-4B
02
Unsloth / Qwen3-4B 4bit
Qwen3 4B
12.4 /
15.0GB
83%
03
HuggingFace / Qwen3-4B
Qwen3 4B 4bit量子化
9.6 /
15.0GB
64%
04
HuggingFace / Qwen3-4B 4bit
Bonsai 27B 1bit
5.9 /
15.0GB
39%
Bonsai 27B 1.58bit（三値）
9.4 /
15.0GB
63%
Bonsai 27B 系
05
Bonsai 27B 1bit
06
Bonsai 27B Ternery
モデル
GPU RAM
相対イメージ
Bonsaiての着目点
27Bでも、1bitなら4B非量子化より軽く動く。
量子化は「節約」ではなく、扱えるモデルの範囲を変える技術。


# Page. 31

![Page Image](https://bcdn.docswell.com/page/87DKPGZ2JG.jpg)

APPENDIX


# Page. 32

![Page Image](https://bcdn.docswell.com/page/VJPKN3DLE8.jpg)

Appendix｜PrismML が実装した Bonsai 実行技術
Source: GitHub
PrismML-Eng
1-bit / ternary 量子化モデルを、GGUF・MLX・llama.cpp 系ランタイムへ接続する実装パッケージ
技術の位置づけ
Model family
Model format
Runtime
Setup scripts
Local API
Bonsai: Q1_0 1-bit
Ternary-Bonsai: Q2_0
サイズ: 27B / 8B / 4B /
1.7B
27B はVLMとして画像
GGUF: llama.cpp 実行
PrismML fork of
llama.cpp
Bonsai向け Q2_0 を追
setup.sh / setup.ps1
download_models.sh
download_binaries.sh
OS・CUDA・ROCm・Vul
kan・CPUを自動判定
llama-server OpenAI互
換REST API RAGアプ
リから同じLLM
Adapterで接続
も扱う
用
MLX: Apple Silicon 向
け
Q2_0 は g128 / g64 で
実行先が異なる
加
Q1_0 は upstream
llama.cpp へ統合済み
互換性の注意点
Q1_0（1-bit）は CPU / Metal / CUDA / Vulkan の upstream llama.cpp で利用可能。
Q2_0（ternary）は移行中。group-128 は PrismML fork、group-64 は mainline 側の形式。
CUDA ternary はまだ upstream review 中のため、Bonsai-demo の fork prebuilt binaries を使うのが安全。
今回のRAGアプリ実装への落とし込み
•
•
•
•
Bonsai-demo/bin/cuda/llama-server
models/bonsai-27B/Bonsai-27B-Q1_0.gguf
localhost の /health と /v1/models で起動検証
LangChain側は OpenAI互換APIとして接続
禁止事項： fork の ggml-* ライブラリだけを stock llama.cpp に差し替えない。ABI / format mismatch でロード失
敗する。
実装上の要点：モデルファイル形式と llama.cpp ビルドを必ず対応させる。Bonsai-demo はモデル取得・バイナリ取得・起
動スクリプトをまとめ、RAGアプリ側は llama-server の OpenAI互換APIとして扱える。


# Page. 33

![Page Image](https://bcdn.docswell.com/page/2EVVK416EQ.jpg)

Bonsai モデル発表時系列まとめ
2026年3月31日
1-bit Bonsai 8B発表
元モデル：Qwen3-8B
2026年4月16日
Ternary Bonsai 8B発表
元モデル：Qwen3-8B
2026年7月14日
1-bit／Ternary Bonsai 27Bを同時発表
元モデル：Qwen3.6-27B
PrismMLについて
PrismMLは、Caltech発のAIスタートアップ
既存LLMを1-bit・三値重みに変換する
「Bonsai」を開発し、端末上で大型モデルを動
かすことを目指しています。
モデル重みは公開されていますが、中核の変換技
術は非公開 で、性能評価は今後の第三者検証が
必要。


# Page. 34

![Page Image](https://bcdn.docswell.com/page/57GLQ122EL.jpg)

GGUFとは ― llama.cpp系で広く使われる LLMモデル保存形式
1. GGUFは「量子化方式」ではない
2. 何が入っている？
GGUF = モデルを保存・配布するためのコンテナ形式量子
モデル重み（FP16 / Q4 / Q5 / Q8 など）
化済みの重みだけでなく、
Tokenizer や各種メタデータも一
Tokenizer 情報
緒に持てる
1つの .gguf ファイルとして扱いやすい
Qwen3-8B-Q4_K_M.gguf
Qwen3-8B ＝ 元モデル
Q4_K_M ＝ 量子化方式
3. なぜ便利？
.gguf ＝ 保存形式
4. よく見る量子化名
Q2 / Q3 とても軽い／劣化大
モデル構造、
RoPE、特殊トークンなどのメタデータ
CPUだけでも動かしやすい
一部レイヤーをGPUへ oﬄoad できる
llama.cpp / Ollama / LM Studio などで広く利用
Q4_K_M 軽さと品質のバランス
Q5 / Q6 品質寄り
Q8 高品質
GGML → GGJT → GGUF ｜ 学習・LoRAでは Transformers / bitsandbytes、配布・ローカル推論では GGUF が使いやすい
要点：GGUF =「量子化そのもの」ではなく、量子化済み LLMを扱いやすくまとめるフォーマット


# Page. 35

![Page Image](https://bcdn.docswell.com/page/4EQYKDP9JP.jpg)

LLM量子化：GGUF / GPTQ / AWQ / bitsandbytes NF4 の違い
目的別に見る「保存形式」
「推論最適化」
「学習・ LoRA向け4bit」の使い分け
GGUF
観点
AWQ
bitsandbytes NF4
Hessian近似を使う PTQ
weight-only量子化
Activationを見て重
要チャネルを守る
weight-only量子化
Transformersで
読み込み時4bit化
NF4はQLoRA由来
GPU推論の省メモリ化
AutoGPTQ / ExLlama系
既存HFモデル運用
高速な4bit推論
GPU / エッジ展開
VLMにも相性良い
LoRA / QLoRA学習
Unsloth / PEFT
1ファイルで扱いやすい
CPU・Apple Siliconにも強い
3〜4bitでも
精度維持しやすい
実績が多い
重要な重みを守るため
低bitでも劣化しにくい
推論速度も出しやすい
学習時のVRAM削減に強い
LoRAと組み合わせやすい実
験サイクルが速い
注意点
GGUF自体はアルゴリ
ズムではない
Transformers学習とは別系統
量子化に校正・変換が必要環
境ごとに実行系の相性あり
一言
「配る・手元で動かす」
位置づけ
主用途
強み
llama.cpp系の
量子化モデル保存形式
（Q4_K_M等を含む）
GPTQ
ローカル推論配布
Ollama / LM Studio
llama.cpp / CPU実行
配布が簡単
「GPU推論を軽くする」
推論向け色が強い
学習用途では通常そのまま使わない
「推論品質と速度の両立」
研究・微調整向け
推論配布形式ではない
CUDA/依存関係の影響を受ける
「4bitで学習・LoRA」
使い分け：学習・実験は NF4、
GPU推論は GPTQ/AWQ、配布・ローカル実行は GGUF


