我們並非每一輪都巡查全部舖位——例如 2024-12-31 該輪主要為補做新擴展的街道,並未再巡查四里核心。若只用「該輪有記錄的舖位」去計算指標,會產生誤導:核心那 126 間並非「當時已消失」,只是「該輪未有巡查」。
因此本網站的做法是:一個舖位在「某個日期」的狀態=它在該日期或之前,最後一次被巡查、記錄下來的觀察。完全未被巡查過方算「未有記錄」。每個指標下方顯示的「覆蓋 X/Y」,X 即以此方法追蹤到該輪有狀態可計算的舖位數目,Y 則為此範圍的舖位總數。
這個指數是從哪裡來的?Shannon 指數源於 1948 年:貝爾實驗室工程師 Claude Shannon 研究通訊時提出「資訊熵」,其核心洞見是——一段訊息的資訊量,等於它有多「難估」。若下一個字必定與上一個相同,該訊息毫無資訊可言;若下一個字完全無法預測,資訊量便最大。1950 年代起,生態學家把同一條公式借來量度物種多樣性:在森林隨機遇上一隻雀鳥,有多難估到牠屬於哪一種?全部同種便完全不用估;種類愈多、分佈愈平均,便愈難估。本站再把它借到街道上——隨機行入一間舖,你有多難估到它是做哪一行?愈難估,代表業態愈多元,H 值愈高。
親手算一次(極簡例子):假設一條街只有 4 間舖。①四間全是茶餐廳:下一間必定是茶餐廳,零驚訝,H = 0。②兩間茶餐廳+兩間藥房:H = ln 2 ≈ 0.69。③四間各屬不同行業:H = ln 4 ≈ 1.39。④三間茶餐廳+一間藥房:雖然同樣是兩個行業,但分佈不平均,H ≈ 0.56,比②低——這正是此公式的特點:種類數目與分佈是否平均,兩者皆計算在內。公式中的 −ln(pᵢ) 可理解為「遇見該類別時的驚訝程度」:佔比愈小的類別,遇見時愈驚訝(佔比 100% 時 ln 1 = 0,即零驚訝);把每類的驚訝程度按其出現機率加權平均,便是 H。
計算方式:將每一間有分類的舖位視為一個資料點,計算其屬於哪個小類(例如「肉檔」「金行」)。若一間舖位填有多過一個分類,則將該舖位的「1」平均分配至其每個分類——例如一間舖位填有 3 個分類,每個分類各得 1/3 ≈ 0.33,並非只計第一個分類。分配完成後,以 Shannon 公式 H = −Σ pᵢ·ln(pᵢ)(pᵢ = 第 i 個小類所佔的比例)計算得出。
載入中…
計算原理:過往的做法有缺陷——一間舖位有多個分類時,只計第一個,其餘全部捨去。例如一間「時裝+特賣場+珠寶鐘錶」的舖位,過往只算作「時裝」,另外兩個分類完全未有計入。分配權重方能合理解釋:「一間舖位就是一間舖位」,不論其填有多少個分類,對整體統計的比重皆為 1,不會因填寫得較詳盡而變相被計算多次。
大類之間與大類之內:我們想了解:業態差異主要來自「跨行業的差異」(例如餐飲與金融),還是「同行業內部愈趨細分」(例如正餐與外賣)?運用 Shannon 的鏈式法則,可將總數精確拆分為兩部分:H總 = H大類之間 + H大類之內(加權平均)——此式在數學上必然成立,並非估算。
載入中…
數值升跌代表的意義:H總上升,即業態愈趨多元;下跌,即愈趨集中於少數行業。若下跌主要來自「大類之間」,即例如整條街愈來愈多舖位經營飲食、其他行業相應減少;若下跌來自「大類之內」,即同一行業內部愈趨單一化(例如飲食業內幾乎只剩外賣)。
H 是對數尺度,數字之間的差距會被壓縮:3.1 與 3.4 看似非常接近,實際差別卻不小。生態學界的慣常做法,是取 e 的 H 次方(記作 e^H,生態學稱為「等效物種數」),把抽象的 H 翻譯回一個直觀單位:「這條街的多元程度,相當於一條有 N 個類別、每類舖位數目完全相同的街」。例如 H = 3.1 時 e^H ≈ 22,H = 3.4 時 e^H ≈ 30——由 3.1 升至 3.4,等於多了 8 個「等效類別」,遠比表面的 0.3 明顯。
載入中…
比較時的三個錨點:
限制:此指數只反映「種類數目與分佈是否平均」,並不評價某種分類「好與不好」——十間金舖與十間各行各業的舖位,若種類數目相若,H 值可以相差不遠,但社區觀感截然不同。此指標亦未計入舖位面積、人流、經濟規模,純粹是「種類分佈」的統計。另外,Shannon 原文以 2 為底數計算(單位是 bit),生態學慣用自然對數 ln,本站跟隨生態學慣例——兩者只差一個固定倍數,任何比較結論皆不受影響。
計算方式:J = H總 ÷ ln(小類數目)——即將多元化指數對比「若現存的小類數目完全平均分佈」的理論最大值,範圍為 0 至 1。
載入中…
數值升跌代表的意義:愈接近 1,代表已出現的每個小類舖位數目愈接近;愈接近 0,代表少數類別佔比過大(例如整條街一半舖位皆為飲食業,其他類別僅得一兩間)。
限制:均勻度只反映「相對分佈」,與「種類數目」(多元化指數本身)是兩回事——種類少但分佈平均,J 值仍可以很高。兩者須一併參考方能全面理解。
計算方式:兩個指標皆只計算「已知連鎖度」的舖位(不含未填寫,或填「未知」的舖位)。小店比率 = 小店數 ÷ 已知連鎖度舖位數;連鎖滲透率 = (中小型連鎖+連鎖大集團+加盟店)數 ÷ 已知連鎖度舖位數。
載入中…
⚠️ 此兩個百分比相加不等於 100%,屬有意設計:連鎖度分級當中有一類稱為「疑似集團但無證據」——觀感類似連鎖店,但巡查時未能查證確實證據(例如未見招牌明確標示所屬集團)。此類舖位兩個指標皆未計入:既不能斷定其為「小店」(很可能並非如此),亦不能斷定其為「已證實的連鎖店」(尚無證據)。因此此兩個百分比相加通常會少於 100%,缺少的部分即為「已知連鎖度舖位當中,疑似但未經證實」的一批。
載入中…
數值升跌代表的意義:小店比率下跌/連鎖滲透率上升,代表該區連鎖化程度加劇,本地獨立小店正逐漸被取代。
限制:「已知連鎖度」只計算巡查時能夠判斷的舖位,若許多舖位填「未知」或未有填寫,兩個比率的樣本將明顯縮小,代表性亦隨之下降。
計算方式:在此範圍有記錄(透過 carry-forward 取得)的舖位當中,現時無人經營的比例。「空置」與「結業」兩種狀態均計入——兩者都代表該舖位現時是吉的,分別只在於記錄時是否知道之前經營的是哪一間(「結業」=知道哪一間執了;「空置」=一直是吉舖,或不知道之前是哪一間)。
載入中…
數值升跌代表的意義:數值上升代表附近舖位愈趨難以租出或乏人接手,屬區內經濟活力的其中一項指標。
限制:「裝修中」不計入空置(裝修完成後多數會重新開業,與真正空置的意義不同);短暫空置與長期吉舖在此指標上無法區分,須參閱 本月變化 個別舖位的歷史紀錄方能分辨。
計算方式:將本輪的狀態與上一輪比較(採用 carry-forward 狀態,而非只看該輪本身的 change_type 欄),凡新開/結業/易手/轉為空置/裝修中皆計為「有變化」,再除以此範圍的覆蓋舖位數。
載入中…
數值升跌代表的意義:數值愈高代表該區變動愈大(較多結業、易手、新開),愈低則代表相對穩定。首輪並無上一輪可作比較,故不計算。
限制:兩輪之間覆蓋的舖位可能並不完全相同(例如某幾間兩輪皆未有巡查到),此指標只計算「兩輪皆有記錄」的舖位,覆蓋樣本愈少便愈不穩定,請留意「覆蓋 X/Y」的數字。
「四里核心」(編號 1–126)、「外圍街道」(廣福道/寶鄉街/運頭街/鄉事會街)、「四個坊」(廣福坊/寶鄉坊/鄉事會坊/運頭坊)此三層互不重疊,可在數據分析頁的「三層比較」一次過並排檢視。選擇哪一層並無對錯之分,視乎所欲了解的問題——想看「最古老的四條里如何變化」就選核心;想看「大街連鎖店如何滲透」就選外圍街道。
平台日後會加入商場對照組(例如大埔超級城),與四里這類露天街舖並列。兩者的數字不能直接相減、直接比大小,原因如下:
本質不同:商場舖位密度、單位面積、租金結構、人流模式,與街舖本質上並不相同——商場舖位普遍細小密集、由單一業主統一招租,街舖則各自獨立業權、面積參差。若只看「商場多元化指數比街舖低」這一個數字就下結論「商場業態較單一、街舖較有活力」,屬於過度簡化,忽略咗兩種場域本來就係為唔同用途而設計。
正確做法:每次比較同時列出三組數字:
換言之,跨場域比較的重點不是「邊個分數高」,而是「喺已知資料嘅前提下,兩種完全唔同嘅商業形態,各自呈現緊點樣嘅業態組合」——請一併參考以上三組數字,而唔好單獨引用某一個百分比作結論。