資料視覺化決策速查表

Visualization Decision Console · 五層模型 v1

從資料結構走到圖表

每一題都只問「資料的結構」,不問「你想畫什麼」。結構是硬約束,最多 7 題就能把上百個圖表名稱收斂到單一家族。

判斷路徑

尚未開始

圖表庫

每張圖表都被拆解成「資料拓撲 → 轉換算子 → 座標系 → 視覺通道」。精度標籤來自解碼精度階梯,用來判斷同一結構下哪個選項較優。

精度
意圖

第一性原理與五層模型

圖表名稱沒有資訊量——它只是前四層選擇的別名。把選擇拆開,選圖就從品味問題變成最佳化問題。

公理 1 · 資料無形狀

資料只有「索引結構(key)」與「量值(measure)」。所謂圖表類型,是人對這組結構施加的一次映射選擇。

公理 2 · 圖表不是類別,是組合

一張圖 = 資料拓撲 × 轉換算子 × 座標系 × 標記 × 通道指派。上百種圖表是少數維度的笛卡兒積,不是平行的分類。

公理 3 · 解碼精度是唯一客觀品質函數

人眼判讀各視覺通道的精度有固定排序。這是生理事實,不是風格偏好,因此可用來排序可行解。

形式化定義

Chart = ⟨ T, τ, C, M, E ⟩ Render = C ∘ E ∘ M ∘ τ(D) 直方圖 = ⟨ 樣本集, 分箱+計數, 笛卡兒, 條, 長度 ⟩ 圓餅圖 = ⟨ 類別向量, 正規化+累積, 極座標, 弧, 角度 ⟩ ← 只差一個 polar 算子 Treemap = ⟨ 樹, squarified, 巢狀, 矩形, 面積 ⟩

解碼精度階梯

位置 長度 斜率 角度 面積 體積 色彩濃度

五層模型

內容選項數自由度
L0 意圖敘事動作:讀者該得到哪一句結論8軟約束 · 決定誰占最高精度通道
L1 結構資料拓撲:索引與量值的代數形狀11 · 資料說了算
L2 轉換stack normalize bin sort polar nest project transpose8少量
L3 座標系笛卡兒 / 極座標 / 地理 / 圖拓撲 / 矩陣 / 巢狀6少量 · 極座標幾乎恆為降級
L4 編碼標記 + 視覺通道指派7主要決策點
L5 命名具名圖表~100零資訊量 · 前四層的別名

L1 · 11 種資料拓撲與其不變量

拓撲形式不變量 / 本質特徵
純量v ∈ ℝ無索引,只能與基準比較
類別向量f : Cat → ℝ索引無序 → 連線在數學上無定義
序列向量f : Time → ℝ索引有序且等距 → 斜率才有意義
樣本集{ xᵢ }捨棄身分,只保留值的密度
單體向量Σ pᵢ = 1和為定值的約束
元組集{ (xᵢ, yᵢ, …) }多測度共變
矩陣Cat × Cat → ℝ雙類別交叉
有根無環圖父子總量守恆
(V, E)位置不承載資料(座標是佈局演算法產物)
加權 DAG節點流入 = 流出
空間場geo → ℝ位置被地理綁定 → 量值只能退到色彩/面積

L0 · 8 個敘事原語 → 通道指派

原語讀者該得到的一句話必須占用最高精度通道的是常見誤配
量級「這個數字有多大」該量值本身用色彩表達量級
差異「A 比 B 高多少」差值本身(考慮直接畫差分)兩根遠離的長條
變化「它往哪走」斜率(時間軸須等距)時間軸不等距
分布「多數落在哪、誰是異常」值域上的位置只給平均值
組成「由什麼構成」各部分長度(而非角度)圓餅圖 + 過多切片
關聯「兩者是否同動」X、Y 雙位置雙 Y 軸假造相關
連結「誰跟誰有關、誰是樞紐」拓撲鄰接關係節點過多的力導向圖
位置「在哪裡發生」地理位置(量值被迫降級)面積大 ≠ 值大

由第一性原理推出的非直覺結論

上線前 6 問

支配關係:這些圖,換一種畫法會更好讀

同一份資料通常有好幾種畫法。如果其中一種能表達的東西一模一樣,却明顯更容易被看錯,那它就沒有存在的必要——這就叫被「支配」。

判斷標準只有一個:人眼能不能把數字看準

人對「長短」和「位置高低」判斷很準,對「角度」「面積大小」「顏色深淺」判斷很差。你可以一眼看出兩根長條誰高、高多少;但兩塊圓餅切片、兩塊色塊,你只能猜。

所以把數字畫成角度或面積的圖(圓餅圖、雷達圖、儀表圖、Treemap),天生就比畫成長度的圖(長條圖)難讀。這不是訫口味問題,是眼睛的生理限制。

什麼時候還是可以用右邊那種?

只有兩個正當理由:一、你只需要讓人「大概有個感覺」,不需要讀出準確數字;二、你的讀者就是習慣看那種格式,換了反而没人看。除此之外,選左邊。