面議(經常性薪資達4萬元或以上) 桃園市大溪區 5年工作經驗 1天前更新
工作內容
1.根據業務與研發需求,規劃 AI GPU Cluster 架構(包含 GPU server / Rack / 散熱、網路、儲存與叢集管理)。
2.規劃並部署 GPU 叢集之運算網路與管理/拓撲架構/交換機選型與組態配置。
3.統籌和配置存儲網路交換機拓撲如 NVMe-oF、RoCEv2、InfiniBand),以確保數據流的穩定性和高效性(存取低延遲與高吞吐)。
4.進行網路效能調優,專注於提升機器學習模型訓練前的網路性能。
5.協調不同技術資源(如 整合伺服器硬體、網路設備、驅動層與叢集排程器),確保 GPU 算力與網路資源的高效協同運作。
6.協助技術問題診斷和故障排除,確保系統的高可用性。
7.指導撰寫設計文件、部署手冊與操作說明,並提供內部培訓與技術支援
8.與跨部門合作,支持整體解決方案架構和技術解決方案的優化。
其他條件
1. 具備伺服器 Cluster 基礎設施建置經驗。
2. 了解IB / RoCE網路拓樸、網路設備與協定。
3. 能讀寫英文技術文件並與國際廠商/供應商溝通協作。
加分項目:
1. 熟悉至少一套叢集管理工具,如 Kubernetes、Slurm。
2. 熟悉Docker container 技術與應用為佳。
3. 具備 Linux 系統管理能力(Ubuntu, CentOS, Debian)。
展開 員工及眷屬喪葬補助社團補助員工電影自強活動員工停車位或停車補助