Hardware Bring-up Issue Report

VCU118 上電不穩定:PGOOD 紅燈、VCCINT 未啟動

間歇性電源啟動失敗的證據整理、根因假設排序與逐步排查流程

板型:Xilinx / AMD VCU118 (VU9P) Rev 2.0 SW16:JTAG 模式 FMC:Zipcores SKU89 FMC-DSP 現象:隨機性,非每次重現 建立日期:2026-08-04

· ↑ Misc Ideas 總覽

01問題摘要與關鍵判讀

VCU118 上電時時好時壞:成功時 PGOOD 綠燈、全部電軌正常、FPGA 可進入初始化;失敗時 PGOOD(DS3)轉紅、VCCINT 指示燈熄滅,而其餘所有電軌讀值皆正常

關鍵判讀 ① 0.24 V 不是「壓不上去」,而是「根本沒開」。
VCCINT 標稱 0.85 V。若是穩壓器有輸出但被過載拉垮,通常會看到明顯的漣波、hiccup 重試或接近但偏低的電壓;0.24 V 是一個沒有任何調節意義的殘壓,比較符合「穩壓器輸出級關閉,VCCINT 節點僅由相鄰 0.85 V 電軌經 FPGA die 內部漏電路徑(以及輸出電容殘電)被拉到某個平衡點」。
→ 調查方向應該是「VCCINT 控制器為什麼沒有 enable/為什麼閂鎖關閉」,而不是「負載太重」。

關鍵判讀 ② 其它電軌全數正常,代表不是 12 V 整體崩潰。
VCC1V8 / VADJ_1V8 / VCCINTIO_BRAM / VCC1V2 / MGTAVCC / MGTAVTT / UTIL_1V35 / UTIL_3V3 全部在標稱值。若 12 V 在突波時整體塌陷,通常不會只死 VCCINT 一軌。
→ 但仍不能排除 12 V 在啟動最初數毫秒的短暫凹陷:VCCINT 是啟動瞬間電流最大、最先動作的電軌,只有它會踩到控制器的 UVLO 邊界;其餘電軌在 VCCINT 已放棄之後才依序啟動,因此看起來一切正常。這正好也能解釋「隨機性」。

關鍵判讀 ③ SW16 = JTAG,FPGA 未載入 bitstream,VCCINT 的靜態負載其實很輕。
在未組態狀態下 VU9P 的 VCCINT 電流遠低於滿載。因此「因為負載太大而過流保護」的可能性偏低;如果 PMBus 狀態暫存器真的回報 IOUT_OC_FAULT,那高度暗示板上有實體短路或功率級/電感元件損壞 → 直接走 RMA 流程。

結論方向:症狀組合(單一電軌、隨機、其餘正常、殘壓非零)最符合 VCCINT 穩壓器啟動階段的間歇性故障閂鎖。實務上請先用第 6 節的 SOP 把「外部因素」(電源供應器、FMC 卡、故障未清除)一一排除;若拆掉 FMC、換用原廠電源、長時間斷電後仍會隨機失敗,即屬板卡硬體問題,應備妥第 8 節資料申請 RMA。

02現況證據(LED 與 SCUI 量測)

2.1 SCUI「Voltages」頁讀值

VCU118 SCUI 的 Voltages 分頁,VCCINT 顯示 0.24 V,其餘電軌皆為標稱值
圖 1 SCUI「Voltages」頁:VCCINT 僅 0.24 V(標稱 0.85 V),而 VCC1V8、VADJ_1V8、VCCINTIO_BRAM、VCC1V2、MGTAVCC、MGTAVTT、UTIL_1V35、UTIL_3V3 全部落在標稱值。讀值能正常取得,代表 System Controller 與 PMBus 通訊本身無異常。
電軌標稱值實測值判定備註
VCCINT0.85 V0.24 VFAIL唯一異常軌;非調節電壓,判定為穩壓器關閉
VCCINTIO_BRAM0.85 V0.85 VOK與 VCCINT 同電位、獨立供電,是最可能的漏電來源
VCC1V81.8 V1.8 VOK
VADJ_1V81.8 V1.8 VOKFMC I/O 電壓,代表 FMC 供電已建立
VCC1V21.2 V1.2 VOK
MGTAVCC0.9 V0.9 VOK
MGTAVTT1.2 V1.2 VOK
UTIL_1V351.35 V1.35 VOKDDR4
UTIL_3V33.3 V3.3 VOK

※ SCUI 能成功讀出所有電軌,代表 System Controller、PMBus 匯流排與 UART 通訊本身正常 —— 問題侷限在 VCCINT 的功率路徑/致能邏輯,不是量測或通訊故障。

2.2 板上 LED 狀態

VCU118 板面近照,DS3 PGOOD 指示燈為紅色,周邊 GPIO LED 與其他電軌 LED 亮起
圖 2 板面近照:DS3(PGOOD)為紅色,DS20、DS26 等其他電軌指示燈正常亮起,DS2 (INIT)/DS34 (DONE) 亦有亮。PGOOD 是各電軌 PG 的匯總指示,紅燈本身不指出是哪一軌,需靠 SCUI(圖 1)定位 —— 本案為 VCCINT。
LED觀察狀態意義
DS3(PGOOD)電源良好鏈結未全數成立;至少一軌 PG 未 assert
VCCINT 指示 LED熄滅與 SCUI 的 0.24 V 一致,該軌未啟動
其餘電軌 LED(DS1/DS15/DS17/DS25/DS26/DS20…)其他電軌皆已建立
DS2 (INIT) / DS34 (DONE)有亮失敗時 FPGA 無法完成初始化;此欄請在失敗當下重新確認並記錄

2.3 重現性

  • 失敗不可穩定重現,同一組配置下時好時壞 → 典型的邊界/間歇性問題(電源餘裕、上電斜率、溫度、接觸電阻)。
  • 目前缺少的關鍵數據(第 6 節會逐項補齊):失敗率統計、有/無 FMC 的對照、12 V 輸入在上電瞬間的波形、PMBus STATUS_* 暫存器內容。

03背景:VCU118 電源架構與 PGOOD 邏輯

  • 輸入:單一 12 V 直流輸入(板附的 6-pin 電源接頭)。板上所有電軌都由這 12 V 經數位 PMBus 穩壓器降壓產生。
  • 穩壓器:VCU118 使用 Maxim 系列 PMBus 數位電源控制器;VCCINT 因電流最大而採用多相架構,啟動延遲(TON_DELAY)、過流/過壓門檻等參數存放在控制器的 NVM 中。確切料號與位號請以該板次的原理圖/BOM 為準。
  • 時序:UltraScale+ 要求 VCCINT 於其它核心電軌之前/同時建立。VCCINT 是啟動序列最前段、且 di/dt 最大的一軌 —— 這使它成為整條 12 V 供電鏈上「餘裕最小」的那一環。
  • PGOOD(DS3):為各電軌 Power-Good 訊號的匯總指示。任一軌未 assert PG 就會顯示紅色,因此 PGOOD 紅燈本身不指出是哪一軌,必須靠個別 LED 或 SCUI 讀值定位 —— 本案已定位到 VCCINT。
  • System Controller:板上微控器透過 PMBus 讀取各穩壓器的電壓/電流/溫度與狀態暫存器,並以 UART 提供給 PC 端的 SCUI 工具。
  • FMC 影響面:FMC 子卡由板上取用 12 V、3.3 V 與 VADJ;其上電突波與電容量會直接反映在 12 V 輸入軌上,並與 VCCINT 的啟動窗口重疊。

04根因假設排序

依「與觀察到的症狀組合之吻合程度」排序。P1 最可能。

P1

VCCINT 穩壓器啟動階段間歇性故障 / 故障閂鎖(板卡硬體問題)

穩壓器在上電當下偵測到(或誤判)故障而閂鎖關閉輸出,且不重試。成因可能是功率級元件老化、電感/電容特性劣化、BGA 或功率元件焊點微裂(冷熱交替時導通與否不同),或控制器本身間歇性失效。

吻合點
只死一軌、其餘正常、隨機、殘壓非零、重新上電有時就好了 —— 完全是閂鎖型故障的行為。
驗證方式
失敗當下讀 PMBus STATUS_WORDSTATUS_VOUTSTATUS_IOUTSTATUS_INPUTSTATUS_TEMPERATURE;用示波器看 VCCINT 上電波形是「完全沒動作」還是「起來後塌掉」。
若成立
板卡硬體問題,走 RMA(見第 8 節)。
P2

12 V 輸入在啟動突波時瞬間跌落(電源供應器/線材/接頭餘裕不足)

VCCINT 多相在啟動時抽取極大瞬間電流;若 12 V 在數十至數百微秒內跌破控制器的 UVLO,控制器會中止啟動並閂鎖。之後負載消失、12 V 回穩,其餘小電流電軌便照常建立 —— 於是看起來「只有 VCCINT 沒起來」。

吻合點
完美解釋隨機性(每次上電的突波時序、電容初始電荷都略有差異)與「只影響最耗流那一軌」。
驗證方式
示波器 DC 耦合探棒直接量 12 V 輸入接頭腳位,觸發設在 11.4 V 下緣,錄整個上電過程;同時比較「有/無 FMC」的波形差異。
若成立
改用原廠隨板電源供應器、更換線材、確認接頭確實壓緊;勿使用轉接/延長/共用電源。
P3

Zipcores SKU89 FMC-DSP 子卡帶來的額外負載或干擾

FMC 子卡的輸入電容在上電瞬間形成額外突波,疊加在 VCCINT 的啟動窗口上;此外若子卡在 FMC 的 I2C 支線上有異常,也可能干擾 System Controller 的匯流排時序。

吻合點
VADJ_1V8 有電代表 FMC 已供電;額外突波與 P2 是相乘效果。
驗證方式
拆掉 FMC 卡,只用裸板做 20 次上電測試;再裝回做 20 次,比較失敗率。這是本案最高投報率的單一實驗。
若成立
失敗率明顯與 FMC 有無相關 → 供電餘裕/突波問題,回頭處理 P2;或聯絡 Zipcores 確認該卡的上電突波與 12 V 需求。
P4

先前的故障閂鎖未被清除(斷電時間不足)

PMBus 穩壓器的故障旗標需要輸入電源真正掉到 UVLO 以下才會重置。板上大容量電解電容使 12 V 掉電緩慢,若只是「關掉再馬上開」,控制器可能從未真正 reset,於是連續多次失敗,直到某次斷電夠久才恢復 —— 這會被誤認為「隨機」。

吻合點
解釋「有時連續失敗、有時連續成功」的群聚現象。
驗證方式
失敗後拔掉電源線等 60 秒以上(不是只按開關)再上電,觀察是否 100% 恢復。
若成立
屬操作程序問題,但仍要追究「第一次觸發閂鎖的原因」——回到 P1/P2。
P5

System Controller 韌體 / 穩壓器 NVM 組態異常

若曾透過 SCUI 或 PMBus 工具改寫過電壓/時序設定,或韌體版本過舊,可能造成 VCCINT 的啟動時序或門檻不正確。

吻合點
解釋力較弱(純軟體組態通常是穩定失敗而非隨機),但成本低、值得排除。
驗證方式
在 SCUI「About」頁記錄韌體版本;比對 AMD 網站的最新 VCU118 System Controller 韌體與板卡設定檔。確認未曾被人為改過 VCCINT 設定。
若成立
依 AMD 官方程序更新韌體/回復預設電源組態。
P6

VCCINT 節點對地短路或異常漏電(FPGA 或去耦電容損壞)

若 VCCINT 平面上有元件損壞形成低阻抗路徑,穩壓器會在啟動時立刻過流並關閉。

吻合點
可解釋 0.24 V 殘壓,但與「有時能正常啟動」矛盾(真短路應該每次都失敗),故排序最後 —— 除非是溫度相關的間歇短路。
驗證方式
完全斷電並放電後,用萬用表量 VCCINT 對 GND 的電阻(在 VCCINT 去耦電容兩端量測)。正常應為數十毫歐等級的低值但不是 0 Ω;若讀到接近 0 Ω,即為短路。可與同型號良品板比對。
若成立
硬體損壞,RMA。

05診斷決策樹

起點
失敗發生後,拔掉電源線靜置 60 秒以上,再上電。是否恢復正常?
是 — 100% 恢復
→ 存在故障閂鎖(P4)。閂鎖被觸發是結果不是原因,繼續往下查觸發源;同時把「長斷電」納入標準操作程序。
否 — 仍隨機失敗
拆掉 Zipcores FMC 子卡,裸板連續上電 20 次,是否 20/20 全部成功?
是 — 裸板全數成功
→ 問題與 FMC 造成的供電負擔相關(P3 + P2)。改用原廠電源/檢查線材接頭,量 12 V 上電波形;必要時向 Zipcores 索取該卡的突波與 12 V 電流規格。
否 — 裸板仍會失敗
換用另一顆原廠規格 12 V 電源供應器與線材後,是否仍失敗?(同時以示波器確認 12 V 上電時未跌破 11.4 V)
否 — 換電源後正常
原電源供應器/線材餘裕不足(P2)。更換即可,並保留原品避免誤用。
是 — 換電源仍失敗
失敗當下讀取 VCCINT 穩壓器的 PMBus STATUS_*:回報哪一類故障?
IOUT_OC_FAULT(過流)
→ 在 JTAG 模式、FPGA 未組態的輕載條件下過流 = 板上實體短路或功率級損壞(P6/P1)。斷電後量 VCCINT 對地電阻佐證,然後 RMA
VIN_UV_FAULT / 輸入欠壓
→ 12 V 在突波時仍跌破門檻(P2)。若已換原廠電源仍如此,代表板上輸入級(輸入電容/保險/接頭)有問題 → RMA。
無故障旗標,或僅顯示「未啟動 / OFF」
→ 控制器根本沒被致能或未執行啟動序列(P1/P5)。先確認韌體與電源組態為原廠預設;若已是預設仍失敗 → RMA

06逐步排查 SOP

請依序執行,每一步都記錄結果(這些記錄同時就是 RMA 申請所需的證據)。

  1. 建立失敗率基線

    目的:把「隨機」量化,之後每個變因才有可比較的基準。

    • 維持目前配置(含 FMC、原用電源),連續上電 20 次
    • 每次:拔電源線 → 等 60 秒 → 上電 → 記錄 PGOOD 顏色、VCCINT LED、SCUI 的 VCCINT 讀值。
    • 記錄環境溫度與板卡是冷機或已運轉發熱(溫度相依性是重要線索)。
    輸出:失敗率 x/20,以及失敗是否群聚出現。
  2. 驗證「長斷電」是否能穩定清除故障

    目的:分辨是「閂鎖未清除」還是「每次上電都獨立失敗」(假設 P4)。

    • 失敗發生後,只按電源開關重開 → 記錄結果。
    • 再拔掉電源線靜置 60 秒以上 → 上電 → 記錄結果。
    判讀:若「短重開常失敗、長斷電幾乎必成功」→ 確認存在故障閂鎖,繼續往下找觸發源;並將長斷電列入日常操作程序。
  3. 移除 FMC 子卡的對照實驗

    目的:本案投報率最高的單一實驗,直接切開「板卡問題」與「系統負載問題」(假設 P3)。

    • 完全斷電後拆下 Zipcores SKU89 FMC-DSP 卡(注意 ESD 防護)。
    • 裸板重複步驟 1 的 20 次測試。
    • 裝回 FMC 再測 20 次。
    判讀:裸板 20/20 成功而裝卡後失敗 → 供電餘裕/突波問題(走步驟 4、5);裸板仍失敗 → 板卡本身問題(走步驟 6、7)。
  4. 電源供應器與線材確認

    目的:排除最常見也最容易修正的外部因素(假設 P2)。

    • 確認使用板卡隨附的原廠 12 V 電源供應器;不要用第三方變壓器、延長線或與其他設備共用的電源。
    • 檢查 6-pin 電源接頭是否完全插到底並卡扣扣住;檢查接腳有無氧化、退針或鬆動(接觸電阻是間歇性問題的經典來源)。
    • 若有第二顆同規格電源供應器,換上後重複步驟 1 測試。
    • 確認牆插供電穩定,避免與大功率設備共用同一迴路。
    判讀:換電源/重插接頭後失敗率歸零 → 根因確定為供電或接觸問題。
  5. 示波器量測 12 V 輸入的上電波形

    目的:直接證實或推翻「輸入欠壓導致啟動中止」(假設 P2)。

    • 探棒 DC 耦合,接地夾就近接板上 GND,量測點取 12 V 輸入接頭腳位(用最短接地路徑,避免長地線造成假振鈴)。
    • 單次觸發(single shot),觸發準位設在約 11.4 V 下緣,時基涵蓋整個上電過程(數十 ms/div,再放大到 µs 級看細節)。
    • 分別擷取「成功一次」與「失敗一次」的波形並存檔對比。
    • 可行的話同時用第二通道量 VCCINT,看它是完全沒動作還是起來後塌掉——這兩者指向完全不同的根因。
    判讀:失敗時 12 V 有明顯凹陷(跌破 ~11.4 V)→ P2 成立。
    VCCINT 完全沒動作 → 致能/時序/閂鎖問題(P1/P5);起來後塌掉 → 過流/短路(P6)。
  6. 讀取 PMBus 故障狀態暫存器

    目的:讓穩壓器自己說出它為什麼關閉——這是整份排查中資訊量最大的一步(詳見第 7 節)。

    • 在失敗狀態下、不要重新上電,直接連 SCUI 讀取。
    • SCUI 的 Power 頁可讀取各電軌的電壓/電流/功率;一併記錄 VCCINT 的電流讀值(若為 0 A → 輸出級確實關閉)。
    • 盡可能取得 VCCINT 穩壓器的 STATUS_WORDSTATUS_VOUTSTATUS_IOUTSTATUS_INPUTSTATUS_TEMPERATURESTATUS_CML
    • About 頁記錄 System Controller 韌體版本。
    判讀:依第 5 節決策樹的最後一層分流。這組資料也是 AMD 支援最想看到的內容。
  7. 斷電後量測 VCCINT 對地阻抗

    目的:排除實體短路(假設 P6)。

    • 完全斷電、拔線,靜置讓大電容放電後再量測。
    • 萬用表電阻檔,量 VCCINT 去耦電容兩端(VCCINT ↔ GND)。正負表棒對調各量一次(半導體接面會造成方向性讀值差異)。
    • 正常應為很低但非零的讀值;接近 0 Ω 即為短路。若有同型良品板,比對讀值最可靠。
    判讀:接近 0 Ω → 硬體損壞,直接 RMA,勿再反覆上電。
  8. 韌體與電源組態確認

    目的:排除軟體組態因素(假設 P5),成本低。

    • 比對 SCUI 回報的韌體版本與 AMD 官方最新版;必要時依官方程序更新。
    • 確認板卡的電源組態未曾被人為透過 PMBus 改寫(若不確定,依官方程序回復原廠預設)。
    • 確認 SW16 等模式開關設定正確、無其他跳線被誤改。
    判讀:已是原廠韌體與預設組態卻仍隨機失敗 → 排除軟體因素,指向硬體。

07PMBus / SCUI 檢查清單

7.1 故障旗標的解讀對照

暫存器 / 旗標若被設起,代表對應假設與行動
STATUS_WORD總覽旗標,指出哪一類故障發生先讀它,再往下讀對應的細項暫存器
IOUT_OC_FAULT(於 STATUS_IOUT輸出過流保護動作P6/P1:輕載下過流極不合理 → 量對地電阻 → RMA
VOUT_UV_FAULT(於 STATUS_VOUT輸出未達目標電壓(啟動逾時)P1/P2:配合 12 V 波形判斷是輸入不足還是功率級失效
VOUT_OV_FAULT輸出過壓回授路徑或控制器異常 → RMA
VIN_UV_FAULT(於 STATUS_INPUT輸入 12 V 低於門檻P2:電源供應器/線材/接頭;若已換原廠電源仍發生 → 板上輸入級問題
OT_FAULT(於 STATUS_TEMPERATURE過溫保護檢查風扇是否運轉、散熱器是否貼合;冷機也失敗則排除此項
STATUS_CML通訊/記憶體/邏輯錯誤P5:PMBus 通訊或 NVM 問題 → 檢查韌體與組態
全部無旗標,輸出為 OFF控制器從未被致能或未跑完啟動序列P1/P5:致能訊號/時序問題,多半是板卡硬體 → RMA

7.2 失敗當下必須抓的資料

SCUI 端

  • Voltages 頁:Get All Voltages 全部截圖
  • Power 頁:各軌電流/功率(特別是 VCCINT 電流是否為 0)
  • Clocks 頁:確認時鐘設定正常
  • About 頁:System Controller 韌體版本
  • VCCINT 穩壓器的 STATUS_* 暫存器內容

板上 / 儀器端

  • LED 全景照(PGOOD、各電軌、INIT、DONE)
  • 12 V 輸入上電波形:成功 vs 失敗 各一份
  • VCCINT 上電波形(有第二通道時)
  • VCCINT 對地電阻讀值(斷電後量測)
  • 失敗率統計表:有 FMC / 無 FMC 各 20 次

注意:若懷疑板上有短路(步驟 7 量到接近 0 Ω,或 PMBus 回報過流),請停止反覆上電,以免二次損壞擴大。

08送修(RMA)判定與需附資料

8.1 符合以下任一條件,即應申請 RMA

  • 拆除 FMC 子卡、改用原廠 12 V 電源、每次都長斷電 60 秒以上 —— 裸板仍會隨機失敗
  • 示波器證實 12 V 輸入全程未跌破門檻,但 VCCINT 完全沒有啟動動作
  • PMBus 在 JTAG 模式、FPGA 未組態的輕載條件下回報 IOUT_OC_FAULT
  • VCCINT 對地電阻接近 0 Ω(實體短路)。
  • 韌體與電源組態確認為原廠預設,仍無法穩定啟動。

8.2 申請時應附上的資料

  • 板卡型號與版次(VCU118 Rev 2.0)、序號、購買時間/通路。
  • 問題描述:上電隨機失敗、PGOOD 紅燈、VCCINT 0.24 V、其餘電軌全部正常。
  • 失敗率統計表:有 FMC / 無 FMC 各 20 次的結果。
  • SCUI Voltages 與 Power 頁截圖(失敗狀態)、韌體版本。
  • PMBus STATUS_* 暫存器內容。
  • LED 狀態照片(成功與失敗各一張)。
  • 12 V 輸入上電波形(成功 vs 失敗)。
  • 已排除項目清單:電源供應器已更換、FMC 已移除、已長斷電清除閂鎖、韌體為最新版。

提示:把「已排除的項目」明確列出,能大幅縮短支援窗口來回確認的時間 —— 這也是第 6 節要求逐步記錄的主要原因。

09參考資料

本報告依據提供的 SCUI 截圖、板上 LED 照片與問題描述整理。第 3 節中未標註確切料號之處,請以該板次原理圖為準;所有量測步驟請在適當 ESD 防護下進行。

Hardware Bring-up Issue Report — English

VCU118 Intermittent Power-Up Failure: PGOOD Red, VCCINT Not Active

Evidence review, ranked root-cause hypotheses, and a step-by-step triage procedure

Board: Xilinx / AMD VCU118 (VU9P) Rev 2.0 SW16: JTAG mode FMC: Zipcores SKU89 FMC-DSP Symptom: random, not reliably reproducible Date: 2026-08-04

· ↑ Back to Misc Ideas

01Summary and Key Interpretation

The VCU118 powers up inconsistently. On a good boot, PGOOD is green, all rails are nominal, and the FPGA initializes. On a failed boot, PGOOD (DS3) turns red and the VCCINT LED stays off, while every other rail reads nominal.

Key insight ① — 0.24 V is not "sagging under load," it means the regulator never turned on.
VCCINT is nominally 0.85 V. A regulator that is switching but overloaded typically shows visible ripple, hiccup retries, or a value close to but below target. 0.24 V is not a regulated level at all — it is consistent with the output stage being off, leaving the VCCINT node pulled to an equilibrium by leakage from the adjacent 0.85 V rail through the FPGA die, plus residual charge on the output capacitors.
→ The investigation should target why the VCCINT controller is not being enabled, or why it latches off — not "the load is too heavy."

Key insight ② — All other rails are nominal, so this is not a global 12 V collapse.
VCC1V8 / VADJ_1V8 / VCCINTIO_BRAM / VCC1V2 / MGTAVCC / MGTAVTT / UTIL_1V35 / UTIL_3V3 are all at their target values. A full 12 V brownout would rarely kill only one rail.
→ However, this does not rule out a brief 12 V dip during the first few milliseconds. VCCINT draws the largest inrush and starts earliest, so it is the only rail that can hit the controller's UVLO threshold. The remaining rails come up afterward — once VCCINT has already given up — and therefore look perfectly healthy. This also explains the randomness.

Key insight ③ — With SW16 = JTAG the FPGA is unconfigured, so the static VCCINT load is light.
An unconfigured VU9P draws far less VCCINT current than a loaded design. That makes "overcurrent due to excessive load" unlikely. If the PMBus status registers do report IOUT_OC_FAULT, it strongly implies a real short or damaged power-stage/inductor components on the board → go straight to the RMA path.

Direction: The symptom combination (single rail, random, everything else nominal, non-zero residual voltage) best matches an intermittent fault latch in the VCCINT regulator during startup. In practice, use the SOP in section 6 to eliminate the external factors first (power supply, FMC card, uncleared fault latch). If the board still fails randomly with the FMC removed, the factory supply in use, and a full power-down between attempts, treat it as a board hardware fault and gather the data in section 8 for an RMA.

02Observed Evidence (LEDs and SCUI)

2.1 SCUI "Voltages" tab readings

VCU118 SCUI Voltages tab showing VCCINT at 0.24 V while all other rails are nominal
Figure 1 — SCUI "Voltages" tab: VCCINT reads only 0.24 V (nominal 0.85 V) while VCC1V8, VADJ_1V8, VCCINTIO_BRAM, VCC1V2, MGTAVCC, MGTAVTT, UTIL_1V35 and UTIL_3V3 all sit at their target values. Every reading being retrievable proves the System Controller and the PMBus link are themselves healthy.
RailNominalMeasuredVerdictNote
VCCINT0.85 V0.24 VFAILOnly failing rail; not a regulated level → regulator is off
VCCINTIO_BRAM0.85 V0.85 VOKSame potential, separate supply — the most likely leakage source
VCC1V81.8 V1.8 VOK
VADJ_1V81.8 V1.8 VOKFMC I/O rail — FMC power is established
VCC1V21.2 V1.2 VOK
MGTAVCC0.9 V0.9 VOK
MGTAVTT1.2 V1.2 VOK
UTIL_1V351.35 V1.35 VOKDDR4
UTIL_3V33.3 V3.3 VOK

Note: SCUI successfully reads every rail, which proves the System Controller, the PMBus bus, and the UART link are all working. The problem is confined to the VCCINT power path / enable logic — it is not a measurement or communication failure.

2.2 On-board LED state

Close-up of the VCU118 board with the DS3 PGOOD indicator lit red and other rail LEDs lit
Figure 2 — Close-up of the board: DS3 (PGOOD) is red, while the other rail indicators (DS20, DS26, …) and DS2 (INIT) / DS34 (DONE) are lit. PGOOD aggregates every rail's power-good signal, so red alone does not identify the failing rail — SCUI (Figure 1) localizes it to VCCINT.
LEDObservedMeaning
DS3 (PGOOD)RedThe power-good chain is incomplete; at least one rail has not asserted PG
VCCINT indicatorOffConsistent with the 0.24 V SCUI reading — rail did not start
Other rail LEDs (DS1/DS15/DS17/DS25/DS26/DS20…)LitAll other rails are up
DS2 (INIT) / DS34 (DONE)LitThe FPGA cannot initialize on a failed boot; re-confirm and log this row at the moment of failure

2.3 Reproducibility

  • The failure is not reliably reproducible — the same configuration sometimes works and sometimes does not. This is the classic signature of a marginal/intermittent problem (supply headroom, ramp timing, temperature, contact resistance).
  • Data still missing (collected in section 6): a failure-rate statistic, a with/without-FMC comparison, a scope capture of the 12 V input during power-up, and the PMBus STATUS_* register contents.

03Background: VCU118 Power Architecture and PGOOD Logic

  • Input: a single 12 V DC feed via the board's 6-pin power connector. Every rail on the board is derived from that 12 V through digital PMBus regulators.
  • Regulators: the VCU118 uses Maxim PMBus digital power controllers. VCCINT is multiphase because it carries the highest current; its start delay (TON_DELAY), overcurrent and overvoltage thresholds live in the controller's NVM. Confirm exact part numbers and reference designators against the schematic for this board revision.
  • Sequencing: UltraScale+ requires VCCINT to come up before or with the other core rails. VCCINT is therefore both the earliest rail in the sequence and the one with the highest di/dt — making it the point of least margin in the whole 12 V chain.
  • PGOOD (DS3): an aggregate indicator of every rail's power-good signal. Any rail failing to assert PG turns it red, so PGOOD red by itself does not identify the rail — the individual LEDs or SCUI must localize it. Here it is localized to VCCINT.
  • System Controller: the on-board microcontroller reads voltage, current, temperature and status registers from each regulator over PMBus and exposes them to the host SCUI application over UART.
  • FMC impact: the mezzanine card draws 12 V, 3.3 V and VADJ from the board. Its inrush and bulk capacitance appear directly on the 12 V input and overlap the VCCINT startup window.

04Ranked Root-Cause Hypotheses

Ordered by how well each fits the observed symptom combination. P1 is the most likely.

P1

Intermittent VCCINT regulator startup failure / fault latch (board hardware)

The regulator detects (or misdetects) a fault at power-up, latches its output off, and does not retry. Causes include aged power-stage components, degraded inductors/capacitors, micro-cracked BGA or power-device solder joints (conducting or not depending on thermal cycling), or an intermittently failing controller.

Fits
One rail dead, everything else nominal, random, non-zero residual, and often fine after another power cycle — exactly latch-off behavior.
How to test
Read PMBus STATUS_WORD / STATUS_VOUT / STATUS_IOUT / STATUS_INPUT / STATUS_TEMPERATURE while failed; scope VCCINT to see whether it never moves or rises then collapses.
If true
Board hardware fault → RMA (section 8).
P2

12 V input dips during inrush (supply, cable, or connector margin)

The VCCINT multiphase draws a very large transient at startup. If 12 V drops below the controller's UVLO for tens to hundreds of microseconds, the controller aborts startup and latches off. The load then disappears, 12 V recovers, and the remaining low-current rails come up normally — so it looks like "only VCCINT failed."

Fits
Explains the randomness perfectly (inrush timing and initial capacitor charge differ every power-up) and why only the highest-current rail is affected.
How to test
DC-coupled scope probe directly on the 12 V input connector pins, single-shot trigger on a falling edge at ~11.4 V, capturing the full power-up; compare with and without the FMC.
If true
Use the factory-supplied adapter, replace the cable, and make sure the connector is fully seated. Avoid adapters, extensions, or shared supplies.
P3

Extra load or interference from the Zipcores SKU89 FMC-DSP card

The mezzanine card's input capacitance adds inrush that lands right on top of the VCCINT startup window. An anomaly on the FMC I2C branch could also disturb System Controller bus timing.

Fits
VADJ_1V8 being live confirms the FMC is powered; its inrush compounds with P2.
How to test
Remove the FMC card and run 20 power cycles on the bare board, then reinstall it and run 20 more. Compare failure rates. This is the single highest-value experiment in the whole investigation.
If true
A clear correlation with the FMC points to a supply-headroom/inrush problem — return to P2, or ask Zipcores for the card's inrush and 12 V current specifications.
P4

A previous fault latch was never cleared (power-down too short)

PMBus regulator fault flags reset only when the input actually falls below UVLO. The board's bulk electrolytics make 12 V decay slowly, so a quick off/on may never reset the controller at all — producing several failures in a row until one power-down is finally long enough. That reads as "random."

Fits
Explains clustering — runs of consecutive failures followed by runs of successes.
How to test
After a failure, unplug the power cable and wait 60+ seconds (not just toggling the switch), then power up and see whether recovery is 100%.
If true
It is a procedural issue, but you still must find what tripped the latch in the first place → back to P1/P2.
P5

System Controller firmware / regulator NVM configuration anomaly

If voltage or timing settings were ever rewritten through SCUI or a PMBus tool, or the firmware is outdated, the VCCINT startup sequence or thresholds may be wrong.

Fits
Weak — a pure configuration error usually fails consistently rather than randomly. Still cheap to rule out.
How to test
Record the firmware version from the SCUI "About" tab; compare against the current AMD VCU118 System Controller firmware and board configuration files. Confirm nobody has modified the VCCINT settings.
If true
Update firmware / restore the default power configuration per AMD's official procedure.
P6

Short or abnormal leakage on the VCCINT node (FPGA or decoupling cap failure)

A damaged component on the VCCINT plane creating a low-impedance path would cause the regulator to trip on overcurrent immediately at startup.

Fits
Would explain the 0.24 V residual, but contradicts the fact that the board sometimes boots fine (a hard short should fail every time) — hence last place, unless it is a temperature-dependent intermittent short.
How to test
With the board fully powered down and discharged, measure VCCINT-to-GND resistance across a VCCINT decoupling capacitor. Expect a very low reading that is nevertheless not 0 Ω; near 0 Ω means a short. Comparing against a known-good board is the most reliable check.
If true
Hardware damage → RMA.

05Diagnostic Decision Tree

Start
After a failure, unplug the power cable, wait 60+ seconds, and power up again. Does it recover?
Yes — recovers 100% of the time
→ A fault latch is present (P4). The latch is a symptom, not the cause — keep going to find the trigger, and make the long power-down part of the standard procedure.
No — still fails randomly
Remove the Zipcores FMC card and run 20 consecutive power cycles on the bare board. All 20 succeed?
Yes — bare board is 20/20
→ The problem is tied to the FMC's load on the supply (P3 + P2). Switch to the factory supply, check cable and connector, capture the 12 V power-up waveform, and if needed obtain the card's inrush / 12 V current specs from Zipcores.
No — bare board still fails
Swap in another 12 V supply of the factory specification plus a different cable. Does it still fail? (Also confirm on the scope that 12 V never drops below ~11.4 V.)
No — fine with the other supply
→ The original supply or cable lacked margin (P2). Replace it and set the original aside so it is not used again by mistake.
Yes — still fails on a known-good supply
Read the VCCINT regulator's PMBus STATUS_* registers at the moment of failure. What class of fault is reported?
IOUT_OC_FAULT (overcurrent)
→ Overcurrent under an unconfigured-FPGA light load is not plausible = a real short or damaged power stage (P6/P1). Confirm with the resistance measurement, then RMA.
VIN_UV_FAULT / input undervoltage
→ 12 V still dips below threshold during inrush (P2). If this persists on a known-good supply, the board's input stage is at fault → RMA.
No fault flags, output simply OFF
→ The controller was never enabled or never ran its startup sequence (P1/P5). Verify firmware and power configuration are factory defaults; if they already are, RMA.

06Step-by-Step Triage Procedure

Work through these in order and record the result of every step — those records are exactly the evidence an RMA request needs.

  1. Establish a failure-rate baseline

    Purpose: quantify "random" so that every later change has something to compare against.

    • Keep the current configuration (FMC installed, current supply) and power up 20 times.
    • Each cycle: unplug the cable → wait 60 s → power up → record PGOOD color, VCCINT LED, and the SCUI VCCINT reading.
    • Note ambient temperature and whether the board was cold or already warm — temperature dependence is a strong clue.
    Output: failure rate x/20, and whether failures cluster together.
  2. Verify whether a long power-down reliably clears the fault

    Purpose: distinguish "latch never cleared" from "each power-up fails independently" (P4).

    • After a failure, toggle the power switch only → record the result.
    • Then unplug the cable, wait 60+ seconds → power up → record the result.
    Read as: if quick restarts usually fail but long power-downs almost always succeed, a fault latch is confirmed. Keep hunting for the trigger, and adopt the long power-down as standard practice.
  3. FMC-removed control experiment

    Purpose: the highest-value single experiment here — it separates a board fault from a system-load problem (P3).

    • With the board fully powered down, remove the Zipcores SKU89 FMC-DSP card (observe ESD precautions).
    • Repeat the 20-cycle test from step 1 on the bare board.
    • Reinstall the FMC and run another 20 cycles.
    Read as: bare board 20/20 but failures with the card → supply headroom / inrush (go to steps 4 and 5). Bare board still fails → the board itself (go to steps 6 and 7).
  4. Check the power supply and cabling

    Purpose: rule out the most common and most easily fixed external factor (P2).

    • Confirm you are using the factory 12 V supply that shipped with the board — no third-party adapters, extension cords, or supplies shared with other equipment.
    • Check that the 6-pin connector is fully seated and latched; inspect the pins for oxidation, retraction, or looseness (contact resistance is a classic source of intermittent faults).
    • If a second supply of the same specification is available, swap it in and repeat step 1.
    • Make sure the wall outlet is stable and not shared with high-power equipment on the same circuit.
    Read as: if swapping the supply or reseating the connector drops the failure rate to zero, the root cause is supply or contact related.
  5. Scope the 12 V input during power-up

    Purpose: directly confirm or eliminate "input undervoltage aborts startup" (P2).

    • Probe DC-coupled, ground clip on a nearby board GND, measuring at the 12 V input connector pins. Keep the ground path short to avoid false ringing from a long ground lead.
    • Single-shot trigger with the level at roughly the 11.4 V falling edge; time base covering the whole power-up (tens of ms/div, then zoom to the µs range for detail).
    • Capture and save one successful and one failed power-up for comparison.
    • If possible, put a second channel on VCCINT to see whether it never moves or rises then collapses — these point to completely different root causes.
    Read as: a visible dip below ~11.4 V on failures → P2 confirmed.
    VCCINT never moves → enable/sequencing/latch problem (P1/P5). Rises then collapses → overcurrent/short (P6).
  6. Read the PMBus fault status registers

    Purpose: let the regulator explain why it shut down — the highest-information step in the whole procedure (details in section 7).

    • Read while the board is in the failed state — do not power cycle first.
    • The SCUI Power tab reports per-rail voltage, current and power; record the VCCINT current (0 A confirms the output stage is off).
    • Capture the VCCINT regulator's STATUS_WORD, STATUS_VOUT, STATUS_IOUT, STATUS_INPUT, STATUS_TEMPERATURE and STATUS_CML.
    • Record the System Controller firmware version from the About tab.
    Read as: branch per the last level of the decision tree in section 5. This is also the data AMD support most wants to see.
  7. Measure VCCINT-to-ground impedance with the board off

    Purpose: rule out a physical short (P6).

    • Power down completely, unplug, and let the bulk capacitors discharge before measuring.
    • With a multimeter on resistance, measure across a VCCINT decoupling capacitor (VCCINT ↔ GND). Take a reading in both probe polarities — semiconductor junctions make the reading direction-dependent.
    • Expect a very low but non-zero value; near 0 Ω means a short. Comparing against a known-good board of the same type is the most reliable interpretation.
    Read as: near 0 Ω → hardware damage. RMA, and stop repeatedly powering the board.
  8. Confirm firmware and power configuration

    Purpose: cheaply eliminate software configuration factors (P5).

    • Compare the SCUI-reported firmware version against the current AMD release; update per the official procedure if needed.
    • Confirm the board's power configuration has not been rewritten over PMBus. If unsure, restore factory defaults using the official procedure.
    • Verify SW16 and all other mode switches and jumpers are set correctly and untouched.
    Read as: factory firmware and defaults still failing randomly → software ruled out, the evidence points to hardware.

07PMBus / SCUI Checklist

7.1 Interpreting the fault flags

Register / flagIf set, it meansMatching hypothesis and action
STATUS_WORDTop-level summary of which fault class occurredRead this first, then drill into the corresponding detail register
IOUT_OC_FAULT (in STATUS_IOUT)Output overcurrent protection trippedP6/P1: overcurrent under a light load makes no sense → measure resistance to ground → RMA
VOUT_UV_FAULT (in STATUS_VOUT)Output never reached target (startup timeout)P1/P2: use the 12 V waveform to tell insufficient input from a failed power stage
VOUT_OV_FAULTOutput overvoltageFeedback path or controller fault → RMA
VIN_UV_FAULT (in STATUS_INPUT)12 V input below thresholdP2: supply / cable / connector. Still happening on the factory supply → board input stage
OT_FAULT (in STATUS_TEMPERATURE)Overtemperature protectionCheck that the fan runs and the heatsink is seated. Failures from cold rule this out
STATUS_CMLCommunication / memory / logic errorP5: PMBus or NVM issue → check firmware and configuration
No flags at all, output OFFController was never enabled or never completed its startup sequenceP1/P5: enable/sequencing problem, usually board hardware → RMA

7.2 Data to capture at the moment of failure

From SCUI

  • Voltages tab: full "Get All Voltages" screenshot
  • Power tab: per-rail current/power (especially whether VCCINT current is 0)
  • Clocks tab: confirm clock settings are normal
  • About tab: System Controller firmware version
  • VCCINT regulator STATUS_* register contents

From the board / instruments

  • Wide photo of all LEDs (PGOOD, rails, INIT, DONE)
  • 12 V power-up waveform: one success, one failure
  • VCCINT power-up waveform (if a second channel is available)
  • VCCINT-to-ground resistance (measured powered down)
  • Failure-rate table: 20 cycles with FMC, 20 without

Caution: if a short is suspected (near 0 Ω in step 7, or a PMBus overcurrent report), stop cycling power to avoid escalating the damage.

08RMA Criteria and Required Documentation

8.1 Any one of these justifies an RMA

  • With the FMC removed, the factory 12 V supply in use, and a 60+ second power-down before every attempt — the bare board still fails randomly.
  • The scope confirms 12 V never drops below threshold, yet VCCINT shows no startup activity at all.
  • PMBus reports IOUT_OC_FAULT under the light load of JTAG mode with an unconfigured FPGA.
  • VCCINT-to-ground resistance is near 0 Ω (physical short).
  • Firmware and power configuration are confirmed factory-default, and the board still will not start reliably.

8.2 What to attach to the request

  • Board model and revision (VCU118 Rev 2.0), serial number, purchase date and channel.
  • Problem description: random power-up failure, PGOOD red, VCCINT at 0.24 V, all other rails nominal.
  • Failure-rate table: 20 cycles with the FMC and 20 without.
  • SCUI Voltages and Power tab screenshots (failed state) and the firmware version.
  • PMBus STATUS_* register contents.
  • LED photos — one successful boot, one failed boot.
  • 12 V power-up waveforms (success vs. failure).
  • A list of what has already been ruled out: supply swapped, FMC removed, latch cleared with a long power-down, firmware at the current release.

Tip: spelling out what has already been eliminated dramatically shortens the back-and-forth with support — which is the main reason section 6 asks you to log every step.

09References

This report is based on the supplied SCUI screenshots, board LED photograph, and problem description. Where section 3 does not name exact part numbers, defer to the schematic for this board revision. Perform all measurements with appropriate ESD precautions.

ハードウェア立ち上げ問題レポート — 日本語

VCU118 電源投入の不安定:PGOOD 赤点灯、VCCINT 未起動

間欠的な電源投入失敗の証拠整理、根本原因仮説の優先順位づけ、および段階的な切り分け手順

ボード:Xilinx / AMD VCU118 (VU9P) Rev 2.0 SW16:JTAG モード FMC:Zipcores SKU89 FMC-DSP 症状:ランダム、毎回は再現しない 作成日:2026-08-04

· ↑ 技術ノート一覧へ戻る

01問題の要約と重要な読み取り

VCU118 の電源投入は時々失敗する。成功時は PGOOD が緑、全レールが公称値、FPGA も初期化に入る。失敗時は PGOOD(DS3)が赤になり、VCCINT の LED が消灯したまま、他のレールはすべて公称値を示す

重要な読み取り ① — 0.24 V は「負荷で落ち込んでいる」のではなく、レギュレータがそもそも起動していないことを意味する。
VCCINT の公称値は 0.85 V である。スイッチングしていて過負荷なだけのレギュレータなら、目に見えるリプル、ヒカップ再起動、あるいは目標値にやや届かない電圧が観測されるのが普通である。0.24 V は調整された電圧レベルではまったくない — 出力段がオフのまま、VCCINT ノードが隣接する 0.85 V レールから FPGA ダイを介して流れ込む漏れ電流と出力コンデンサの残留電荷によって、ある平衡点まで引き上げられている状態と整合する。
→ 調査は「負荷が重すぎる」ではなく、なぜ VCCINT コントローラがイネーブルされないのか、あるいはなぜラッチオフするのかに向けるべきである。

重要な読み取り ② — 他のレールがすべて公称値なので、12 V 全体の崩壊ではない。
VCC1V8 / VADJ_1V8 / VCCINTIO_BRAM / VCC1V2 / MGTAVCC / MGTAVTT / UTIL_1V35 / UTIL_3V3 はいずれも目標値にある。12 V が完全にブラウンアウトしたのであれば、1 本のレールだけが落ちることはまずない。
→ ただしこれは、起動最初の数ミリ秒における 12 V の短時間の落ち込みを否定するものではない。VCCINT は突入電流が最も大きく、最も早く立ち上がるため、コントローラの UVLO しきい値に触れうる唯一のレールである。残りのレールは VCCINT がすでにあきらめた後で立ち上がるので、まったく健全に見える。これはランダム性の説明にもなる。

重要な読み取り ③ — SW16 = JTAG では FPGA は未コンフィグであり、VCCINT の静的負荷は軽い。
未コンフィグの VU9P が引く VCCINT 電流は、コンフィグ済み設計に比べてはるかに小さい。したがって「過大な負荷による過電流」は考えにくい。それでも PMBus のステータスレジスタが IOUT_OC_FAULT を報告するなら、ボード上に実際の短絡、あるいはパワーステージ/インダクタの損傷がある可能性が高い → ただちに RMA の流れに進むこと。

方向性:症状の組み合わせ(単一レール、ランダム、他はすべて公称値、残留電圧が非ゼロ)は、起動時における VCCINT レギュレータの間欠的なフォールトラッチに最もよく一致する。実務上は第 6 節の SOP を用いて外部要因(電源、FMC カード、未解除のフォールトラッチ)を先に潰すこと。FMC を外し、純正電源を使い、試行ごとに完全に電源を落としてもなおランダムに失敗するなら、ボードのハードウェア故障とみなし、第 8 節の資料をそろえて RMA を申請する。

02観測された証拠(LED と SCUI)

2.1 SCUI「Voltages」タブの読み値

VCU118 SCUI Voltages tab showing VCCINT at 0.24 V while all other rails are nominal
図 1 — SCUI「Voltages」タブ:VCCINT はわずか 0.24 V(公称 0.85 V)である一方、VCC1V8、VADJ_1V8、VCCINTIO_BRAM、VCC1V2、MGTAVCC、MGTAVTT、UTIL_1V35、UTIL_3V3 はいずれも目標値にある。すべての値が読み出せているという事実自体が、System Controller と PMBus リンクが健全であることを示している。
レール公称実測判定備考
VCCINT0.85 V0.24 VFAIL唯一の異常レール。調整された電圧レベルではない → レギュレータはオフ
VCCINTIO_BRAM0.85 V0.85 VOK同電位だが別電源 — 最も可能性の高い漏れ電流源
VCC1V81.8 V1.8 VOK
VADJ_1V81.8 V1.8 VOKFMC I/O 用レール — FMC への給電は確立している
VCC1V21.2 V1.2 VOK
MGTAVCC0.9 V0.9 VOK
MGTAVTT1.2 V1.2 VOK
UTIL_1V351.35 V1.35 VOKDDR4
UTIL_3V33.3 V3.3 VOK

補足:SCUI がすべてのレールを読み出せているということは、System Controller、PMBus バス、UART リンクのいずれも動作していることの証明である。問題は VCCINT の電源経路/イネーブルロジックに限定されており、測定や通信の失敗ではない。

2.2 ボード上の LED の状態

Close-up of the VCU118 board with the DS3 PGOOD indicator lit red and other rail LEDs lit
図 2 — ボードの拡大写真:DS3(PGOOD)が赤である一方、他のレール表示(DS20、DS26 など)と DS2(INIT)/DS34(DONE)は点灯している。PGOOD は全レールのパワーグッド信号を集約したものなので、赤いというだけでは異常レールを特定できない — SCUI(図 1)によって VCCINT に絞り込まれる。
LED観測意味
DS3 (PGOOD)パワーグッドの連鎖が成立していない。少なくとも 1 本のレールが PG をアサートしていない
VCCINT 表示消灯SCUI の 0.24 V という読み値と整合 — レールが起動しなかった
他のレール LED(DS1/DS15/DS17/DS25/DS26/DS20 など)点灯他のレールはすべて立ち上がっている
DS2 (INIT) / DS34 (DONE)点灯失敗時は FPGA が初期化できないはずである。この行は失敗した瞬間にあらためて確認し記録すること

2.3 再現性

  • この不具合は確実には再現しない — 同じ構成でも成功したり失敗したりする。これはマージナル/間欠故障(電源の余裕、立ち上がりタイミング、温度、接触抵抗)の典型的な特徴である。
  • まだ足りないデータ(第 6 節で取得する):失敗率の統計、FMC の有無による比較、電源投入時の 12 V 入力のオシロ波形、そして PMBus の STATUS_* レジスタの内容。

03背景:VCU118 の電源構成と PGOOD ロジック

  • 入力:ボードの 6 ピン電源コネクタから供給される単一の 12 V DC。ボード上のすべてのレールは、この 12 V からデジタル PMBus レギュレータを介して生成される。
  • レギュレータ:VCU118 は Maxim の PMBus デジタル電源コントローラを使用している。VCCINT は電流が最も大きいためマルチフェーズ構成であり、起動遅延(TON_DELAY)、過電流・過電圧しきい値はコントローラの NVM に保持されている。正確な型番とリファレンスデシグネータは、当該ボードリビジョンの回路図で確認すること。
  • シーケンス:UltraScale+ では VCCINT が他のコアレールより先に、または同時に立ち上がる必要がある。したがって VCCINT はシーケンス中で最も早いレールであると同時に、di/dt が最も大きいレールでもあり、12 V 系全体の中で最も余裕のない点となる。
  • PGOOD (DS3):全レールのパワーグッド信号を集約した表示である。いずれか 1 本でも PG をアサートしなければ赤になるため、PGOOD が赤というだけではレールを特定できない — 個別 LED または SCUI で絞り込む必要がある。今回は VCCINT に絞り込まれている。
  • System Controller:ボード上のマイコンが PMBus 経由で各レギュレータから電圧・電流・温度・ステータスレジスタを読み出し、UART 経由でホストの SCUI アプリケーションに提供する。
  • FMC の影響:メザニンカードはボードから 12 V、3.3 V、VADJ を引く。その突入電流とバルク容量は 12 V 入力に直接現れ、VCCINT の起動ウィンドウと重なる。

04根本原因仮説の優先順位

観測された症状の組み合わせにどれだけよく適合するかで並べてある。P1 が最も可能性が高い。

P1

VCCINT レギュレータの起動時における間欠故障/フォールトラッチ(ボードのハードウェア)

レギュレータが電源投入時にフォールトを検出(あるいは誤検出)して出力をラッチオフし、リトライしない状態。原因としては、パワーステージ部品の劣化、インダクタ/コンデンサの特性低下、BGA やパワーデバイスのはんだ接合のマイクロクラック(熱サイクル次第で導通したりしなかったりする)、あるいはコントローラ自体の間欠故障が考えられる。

適合する点
1 本のレールだけが死に、他はすべて公称値、ランダムに発生し、残留電圧は非ゼロで、電源を入れ直すと直ることが多い — まさにラッチオフの挙動である。
検証方法
失敗状態のまま PMBus の STATUS_WORD / STATUS_VOUT / STATUS_IOUT / STATUS_INPUT / STATUS_TEMPERATURE を読む。あわせて VCCINT をオシロで観測し、まったく動かないのか立ち上がってから崩れるのかを見る。
該当した場合
ボードのハードウェア故障 → RMA(第 8 節)。
P2

突入電流時に 12 V 入力が落ち込む(電源・ケーブル・コネクタの余裕不足)

VCCINT のマルチフェーズは起動時に非常に大きな過渡電流を引く。12 V が数十〜数百マイクロ秒のあいだコントローラの UVLO を下回ると、コントローラは起動を中止してラッチオフする。すると負荷が消えて 12 V は回復し、残りの低電流レールは正常に立ち上がる — 結果として「VCCINT だけが失敗した」ように見える。

適合する点
ランダム性をきれいに説明できる(突入のタイミングとコンデンサの初期電荷は毎回異なる)うえ、なぜ最大電流のレールだけが影響を受けるのかも説明できる。
検証方法
12 V 入力コネクタのピンに DC 結合でプローブを当て、約 11.4 V の立ち下がりエッジでシングルショットトリガをかけ、電源投入の全体を取り込む。FMC の有無で比較すること。
該当した場合
純正付属のアダプタを使い、ケーブルを交換し、コネクタが確実に嵌合していることを確認する。変換アダプタ、延長ケーブル、他機器との電源共用は避ける。
P3

Zipcores SKU89 FMC-DSP カードによる追加負荷または干渉

メザニンカードの入力容量が加わることで、突入電流がちょうど VCCINT の起動ウィンドウに重なる。また FMC 側の I2C 分岐に異常があれば、System Controller のバスタイミングを乱す可能性もある。

適合する点
VADJ_1V8 が生きていることから FMC に給電されているのは確実であり、その突入電流は P2 と重畳する。
検証方法
FMC カードを外した状態でベアボードの電源を 20 回投入し、次に取り付けてさらに 20 回投入して失敗率を比較する。この調査全体で最も価値の高い単一実験である。
該当した場合
FMC との明確な相関は電源余裕/突入電流の問題を示す — P2 に戻るか、カードの突入電流と 12 V 電流仕様を Zipcores に問い合わせる。
P4

以前のフォールトラッチが解除されていない(電源断の時間が短すぎる)

PMBus レギュレータのフォールトフラグは、入力が実際に UVLO を下回ったときにのみリセットされる。ボードのバルク電解コンデンサのせいで 12 V はゆっくりしか下がらないため、素早く切って入れ直すだけではコントローラがまったくリセットされないことがある — その結果、十分長い電源断が来るまで連続して失敗する。これが「ランダム」に見える。

適合する点
失敗が固まって起き、そのあと成功が続くというクラスタ性を説明できる。
検証方法
失敗したら電源ケーブルを抜いて 60 秒以上待ってから(スイッチを切るだけでは不十分)投入し、100 % 復帰するかを見る。
該当した場合
手順上の問題ではあるが、そもそも何がラッチを引き起こしたのかは依然として突き止める必要がある → P1/P2 に戻る。
P5

System Controller ファームウェア/レギュレータ NVM の設定異常

SCUI や PMBus ツールから電圧・タイミング設定が書き換えられたことがある場合、あるいはファームウェアが古い場合、VCCINT の起動シーケンスやしきい値が誤っている可能性がある。

適合する点
弱い — 純粋な設定ミスなら通常はランダムではなく毎回失敗する。ただし除外するコストは小さい。
検証方法
SCUI の「About」タブでファームウェアバージョンを記録し、現行の AMD VCU118 System Controller ファームウェアおよびボード設定ファイルと照合する。VCCINT の設定を誰も変更していないことを確認する。
該当した場合
AMD の公式手順に従ってファームウェアを更新するか、既定の電源設定を復元する。
P6

VCCINT ノードの短絡または異常な漏れ電流(FPGA またはデカップリングコンデンサの故障)

VCCINT プレーン上の部品が損傷して低インピーダンス経路ができていれば、レギュレータは起動直後に過電流でトリップする。

適合する点
0.24 V の残留電圧は説明できるが、ときどき正常に起動するという事実と矛盾する(完全な短絡なら毎回失敗するはず)。したがって温度依存の間欠短絡でない限り、優先度は最下位。
検証方法
完全に電源を落として放電させた状態で、VCCINT のデカップリングコンデンサの両端で VCCINT–GND 間抵抗を測定する。非常に低い値が出るが0 Ω ではないのが正常。0 Ω 近傍なら短絡である。正常品のボードと比較するのが最も確実な判断方法である。
該当した場合
ハードウェア損傷 → RMA。

05診断の判定フロー

開始
失敗したら電源ケーブルを抜き、60 秒以上待ってから投入し直す。復帰するか?
はい — 100 % 復帰する
フォールトラッチが存在する(P4)。ラッチは症状であって原因ではない — 引き金を探し続けること。あわせて長時間の電源断を標準手順に組み込む。
いいえ — 依然としてランダムに失敗する
Zipcores の FMC カードを外し、ベアボードで連続 20 回電源を投入する。20 回すべて成功するか?
はい — ベアボードは 20/20
→ 問題は FMC が電源に与える負荷に関係している(P3 + P2)。純正電源に交換し、ケーブルとコネクタを確認し、12 V の電源投入波形を取得する。必要なら Zipcores からカードの突入電流/12 V 電流仕様を入手する。
いいえ — ベアボードでも失敗する
純正仕様の別の 12 V 電源と別のケーブルに交換する。それでも失敗するか?(あわせて 12 V が約 11.4 V を下回らないことをオシロで確認する。)
いいえ — 別電源なら問題ない
元の電源またはケーブルの余裕が不足していた(P2)。交換し、元の物は誤って再使用しないよう隔離しておく。
はい — 正常な電源でも失敗する
失敗した瞬間に VCCINT レギュレータの PMBus STATUS_* レジスタを読む。どの種類のフォールトが報告されているか?
IOUT_OC_FAULT(過電流)
→ 未コンフィグ FPGA の軽負荷で過電流はあり得ない = 実際の短絡またはパワーステージの損傷(P6/P1)。抵抗測定で確認したうえで RMA
VIN_UV_FAULT/入力低電圧
→ 突入電流時に 12 V がしきい値を下回っている(P2)。正常な電源でも続くならボードの入力段の問題 → RMA。
フォールトフラグなし、出力が単にオフ
→ コントローラがイネーブルされていない、または起動シーケンスを実行していない(P1/P5)。ファームウェアと電源設定が工場出荷時の既定値であることを確認し、そうであれば RMA

06段階的な切り分け手順(SOP)

以下を順に実施し、各手順の結果を必ず記録すること — その記録がそのまま RMA 申請に必要な証拠になる。

  1. 失敗率のベースラインを取る

    目的:「ランダム」を数値化し、以降のすべての変更に比較対象を与える。

    • 現在の構成(FMC 装着、現在の電源)のまま 20 回電源を投入する。
    • 各回:ケーブルを抜く → 60 秒待つ → 投入 → PGOOD の色、VCCINT の LED、SCUI の VCCINT 読み値を記録する。
    • 周囲温度と、ボードが冷えていたか既に暖まっていたかも記録する — 温度依存性は有力な手がかりになる。
    成果物:失敗率 x/20、および失敗が固まって発生するかどうか。
  2. 長時間の電源断でフォールトが確実に解除されるかを確認する

    目的:「ラッチが解除されていない」のか「毎回独立に失敗している」のかを切り分ける(P4)。

    • 失敗したら、まず電源スイッチだけを入れ直して結果を記録する。
    • 次にケーブルを抜き、60 秒以上待ってから投入して結果を記録する。
    読み方:素早い再投入はたいてい失敗するのに、長時間の電源断ならほぼ必ず成功するなら、フォールトラッチが確定である。引き金の追跡は続けつつ、長時間の電源断を標準手順とする。
  3. FMC を外した対照実験

    目的:ここで最も価値の高い単一実験。ボードの故障とシステム負荷の問題を分離する(P3)。

    • 完全に電源を落とした状態で Zipcores SKU89 FMC-DSP カードを外す(ESD 対策を実施のこと)。
    • ベアボードで手順 1 の 20 回試験を繰り返す。
    • FMC を取り付け直し、さらに 20 回実施する。
    読み方:ベアボードが 20/20 でカード装着時のみ失敗する → 電源余裕/突入電流の問題(手順 4・5 へ)。ベアボードでも失敗する → ボード自体の問題(手順 6・7 へ)。
  4. 電源とケーブルを確認する

    目的:最も一般的で最も簡単に直せる外部要因を除外する(P2)。

    • ボードに付属していた純正 12 V 電源を使っていることを確認する — サードパーティ製アダプタ、延長ケーブル、他機器と共用の電源は不可。
    • 6 ピンコネクタが奥まで挿さりラッチされていることを確認し、ピンの酸化・後退・緩みを点検する(接触抵抗は間欠故障の古典的な原因である)。
    • 同一仕様の予備電源があれば交換し、手順 1 を繰り返す。
    • コンセントが安定しており、同一系統に大電力機器がぶら下がっていないことを確認する。
    読み方:電源交換やコネクタの挿し直しで失敗率がゼロになるなら、根本原因は電源または接触に関係している。
  5. 電源投入時の 12 V 入力をオシロで観測する

    目的:「入力低電圧が起動を中止させている」を直接確認、あるいは除外する(P2)。

    • DC 結合でプローブし、グランドクリップは近傍のボード GND に取り、12 V 入力コネクタのピンで測定する。長いグランドリードによる偽のリンギングを避けるため、グランド経路は短く保つこと。
    • トリガレベルを11.4 V の立ち下がり付近に置いてシングルショット。時間軸は電源投入全体を含む範囲(数十 ms/div)とし、その後 µs 領域に拡大して細部を見る。
    • 成功時と失敗時をそれぞれ 1 回ずつ取得して保存し、比較する。
    • 可能なら 2 チャネル目を VCCINT に当て、まったく動かないのか立ち上がってから崩れるのかを見る — この 2 つはまったく別の原因を示す。
    読み方:失敗時に約 11.4 V を下回る落ち込みが見える → P2 確定。
    VCCINT がまったく動かない → イネーブル/シーケンス/ラッチの問題(P1/P5)。立ち上がってから崩れる → 過電流/短絡(P6)。
  6. PMBus のフォールトステータスレジスタを読む

    目的:なぜ停止したのかをレギュレータ自身に語らせる — 手順全体で最も情報量の多いステップ(詳細は第 7 節)。

    • 失敗した状態のまま読むこと。先に電源を入れ直してはいけない。
    • SCUI の Power タブはレールごとの電圧・電流・電力を表示する。VCCINT の電流を記録する(0 A なら出力段がオフであることの裏付けになる)。
    • VCCINT レギュレータの STATUS_WORDSTATUS_VOUTSTATUS_IOUTSTATUS_INPUTSTATUS_TEMPERATURESTATUS_CML を取得する。
    • About タブで System Controller のファームウェアバージョンを記録する。
    読み方:第 5 節の判定フロー最終段に従って分岐する。ここは AMD サポートが最も見たがるデータでもある。
  7. 電源オフの状態で VCCINT–GND 間インピーダンスを測る

    目的:物理的な短絡を除外する(P6)。

    • 完全に電源を落としてケーブルを抜き、バルクコンデンサが放電するのを待ってから測定する。
    • テスタの抵抗レンジで、VCCINT のデカップリングコンデンサ両端(VCCINT ↔ GND)を測る。半導体接合の影響で読み値は極性に依存するため、プローブの向きを入れ替えて両方向で測ること。
    • 非常に低いが 0 ではない値が期待値。0 Ω 近傍なら短絡である。同型の正常品ボードと比較するのが最も確実な解釈方法である。
    読み方:0 Ω 近傍 → ハードウェア損傷。RMA とし、繰り返しの電源投入はやめること。
  8. ファームウェアと電源設定を確認する

    目的:ソフトウェア設定の要因を低コストで除外する(P5)。

    • SCUI が表示するファームウェアバージョンを AMD の現行リリースと比較し、必要なら公式手順で更新する。
    • ボードの電源設定が PMBus 経由で書き換えられていないことを確認する。不明なら公式手順で工場出荷時の既定値に戻す。
    • SW16 とその他のモードスイッチ・ジャンパが正しく設定され、変更されていないことを確認する。
    読み方:純正ファームウェアと既定設定でもランダムに失敗するなら、ソフトウェアは除外され、証拠はハードウェアを指している。

07PMBus / SCUI チェックリスト

7.1 フォールトフラグの読み解き方

レジスタ/フラグセットされている場合の意味対応する仮説と処置
STATUS_WORDどの種類のフォールトが起きたかの上位サマリまずこれを読み、対応する詳細レジスタに掘り下げる
IOUT_OC_FAULTSTATUS_IOUT 内)出力過電流保護がトリップしたP6/P1:軽負荷で過電流はあり得ない → 対地抵抗を測定 → RMA
VOUT_UV_FAULTSTATUS_VOUT 内)出力が目標値に到達しなかった(起動タイムアウト)P1/P2:12 V 波形で入力不足かパワーステージ故障かを判別する
VOUT_OV_FAULT出力過電圧フィードバック経路またはコントローラの故障 → RMA
VIN_UV_FAULTSTATUS_INPUT 内)12 V 入力がしきい値を下回ったP2:電源/ケーブル/コネクタ。純正電源でも起きるならボードの入力段
OT_FAULTSTATUS_TEMPERATURE 内)過温度保護ファンが回りヒートシンクが密着しているか確認する。冷間から失敗するならこれは除外できる
STATUS_CML通信/メモリ/ロジックのエラーP5:PMBus または NVM の問題 → ファームウェアと設定を確認
フラグは何も立たず、出力だけオフコントローラがイネーブルされなかった、または起動シーケンスを完了しなかったP1/P5:イネーブル/シーケンスの問題。通常はボードのハードウェア → RMA

7.2 失敗した瞬間に取得すべきデータ

SCUI 側

  • Voltages タブ:「Get All Voltages」の全体スクリーンショット
  • Power タブ:レールごとの電流/電力(特に VCCINT の電流が 0 かどうか)
  • Clocks タブ:クロック設定が正常であることの確認
  • About タブ:System Controller のファームウェアバージョン
  • VCCINT レギュレータの STATUS_* レジスタの内容

ボード/計測器側

  • 全 LED が写る引きの写真(PGOOD、各レール、INIT、DONE)
  • 12 V の電源投入波形:成功時 1 回、失敗時 1 回
  • VCCINT の電源投入波形(2 チャネル目が使える場合)
  • VCCINT–GND 間抵抗(電源オフで測定)
  • 失敗率の表:FMC あり 20 回、なし 20 回

注意:短絡が疑われる場合(手順 7 で 0 Ω 近傍、または PMBus が過電流を報告)は、損傷の拡大を避けるため電源の投入を繰り返さないこと

08RMA の判定基準と添付すべき資料

8.1 以下のいずれか 1 つに該当すれば RMA を申請してよい

  • FMC を外し、純正 12 V 電源を使い、毎回 60 秒以上の電源断を挟んでも — ベアボードが依然としてランダムに失敗する
  • オシロで 12 V がしきい値を下回らないことを確認したにもかかわらず、VCCINT に起動の兆候がまったくない
  • FPGA 未コンフィグの JTAG モードという軽負荷にもかかわらず、PMBus が IOUT_OC_FAULT を報告する。
  • VCCINT–GND 間抵抗が 0 Ω 近傍である(物理的短絡)。
  • ファームウェアと電源設定が工場出荷時の既定値であることを確認済みで、それでも安定して起動しない。

8.2 申請時に添付するもの

  • ボードの型式とリビジョン(VCU118 Rev 2.0)、シリアル番号、購入日と購入経路。
  • 症状の説明:ランダムな電源投入失敗、PGOOD 赤、VCCINT 0.24 V、他レールはすべて公称値。
  • 失敗率の表:FMC あり 20 回、なし 20 回。
  • SCUI の Voltages タブと Power タブのスクリーンショット(失敗状態)およびファームウェアバージョン。
  • PMBus STATUS_* レジスタの内容。
  • LED の写真 — 成功時と失敗時をそれぞれ 1 枚。
  • 12 V の電源投入波形(成功 vs 失敗)。
  • すでに除外した項目の一覧:電源交換済み、FMC 取り外し済み、長時間の電源断でラッチ解除済み、ファームウェアは現行リリース。

ヒント:すでに除外した項目を明示すると、サポートとのやり取りが劇的に短くなる。第 6 節で各手順の記録を求めているのは、主にそのためである。

09参考資料

本レポートは、提供された SCUI のスクリーンショット、ボード LED の写真、および問題の記述に基づいてまとめたものである。第 3 節で正確な型番を明記していない箇所については、当該ボードリビジョンの回路図を優先すること。すべての測定は適切な ESD 対策のもとで実施すること。