VLOBS.COM – Pelatihan model AI kini meluas dari satu pusat data ke beberapa lokasi. Perubahan ini memungkinkan operator menempatkan komputasi di tempat yang memiliki lebih banyak pasokan daya atau ruang, tetapi juga membuat jaringan antarlokasi menjadi bagian penting dari kinerja pelatihan.
Google menyebut Gemini dilatih secara sinkron di klaster berbagai lokasi. Microsoft menghubungkan pusat data AI di Wisconsin dan Georgia sebagai satu superkomputer AI terdistribusi, sementara AWS menghubungkan klaster komputasi AI di area yang luas untuk mendukung Anthropic membangun model Claude. Meta juga membangun koneksi antarpusat data berkapasitas tinggi untuk pelatihan model. CoreWeave dan Google Cloud baru-baru ini mengumumkan pelatihan lintas cloud melalui koneksi privat.
Menurut Cisco, pelatihan model saat ini dapat memerlukan klaster berisi puluhan ribu GPU. Akselerator tersebut memproses bagian model atau batch data yang berbeda, tetapi perlu bertukar hasil dan melakukan sinkronisasi sebelum melanjutkan tahap berikutnya. Data yang dikirim umumnya berupa angka, seperti gradien dan hasil antara, bukan teks atau gambar pelatihan.
Baca juga: Instinct Hadapi Persaingan Muse dan Dots dengan Asisten Berbasis Teks
Sinkronisasi membuat jaringan berpengaruh pada waktu komputasi
Ramesh Sivakolundu dari tim arsitektur Silicon One Cisco menjelaskan bahwa pekerjaan pelatihan berulang kali menjalankan komputasi lalu sinkronisasi. Ketika banyak akselerator mulai mengirim data bersamaan, lalu lintas dapat menumpuk pada satu tujuan. Dalam pelatihan sinkron, kelompok GPU yang lebih cepat tidak bisa begitu saja melanjutkan tanpa menunggu pertukaran data selesai. Akibatnya, keterlambatan jaringan dapat memperpanjang waktu komputasi.
Gangguan atau paket yang hilang tidak selalu menghentikan seluruh pelatihan. Namun, aliran data yang tertunda atau terputus dapat memerlukan pengiriman ulang, memperlama komunikasi kolektif, dan membuat akselerator lain menunggu. Kegagalan yang lebih serius dapat membuat pelatihan kembali ke checkpoint yang tersimpan.
Baca juga: TypeSafe AI Raih US$870 Juta, Valuasi Jev Tembus US$7,5 Miliar
Cisco membedakan kebutuhan ini dari koneksi antarpusat data konvensional, yang biasanya menghubungkan lingkungan pusat data independen untuk redundansi, jangkauan, dan distribusi beban kerja. Pada pelatihan AI lintas lokasi, jaringan antarsitus menjadi bagian dari komputasi terkoordinasi sehingga kapasitas dan pengiriman data yang dapat diprediksi menjadi penting.
Jarak menambah kebutuhan bandwidth dan buffering
Menurut pemodelan Cisco untuk penerapan AI terdistribusi berskala besar, kebutuhan bandwidth agregat dapat mencapai sekitar 14 kali patokan koneksi antarpusat data konvensional. Cisco juga memperkirakan bahwa menghubungkan dua lokasi AI berkapasitas 100MW dapat membutuhkan 12.000 hingga 32.000 port optik koheren pada lapisan scale-across. Sebagai perbandingan, koneksi antarpusat data konvensional antara fasilitas sebanding diperkirakan memerlukan sekitar 1.000 hingga 2.000 port.
Jarak juga memperpanjang waktu yang dibutuhkan sinyal pengendalian kemacetan untuk mencapai pengirim. Cisco menghitung bahwa pada koneksi 800 Gbps sepanjang 100 km, sekitar 100 MB data dapat berada dalam perjalanan selama jeda umpan balik tersebut. Cisco berpendapat bahwa buffering yang lebih dalam dapat membantu menampung lonjakan sementara, sementara pengelolaan kemacetan menangani penyebabnya. Kapasitas tambahan tetap diperlukan untuk mengatasi kemacetan yang berlangsung terus-menerus.
Baca juga: Cramer Soroti Ujian Bank dan Saham Chip pada Pekan Laporan
Dalam rancangan scale-across Cisco, Silicon One P200 menjadi prosesor perutean yang dapat diprogram dengan kapasitas 51,2 Tbps dan buffering dalam. Chip itu digunakan pada platform Cisco 8223 dan Cisco N9000, serta dapat dipasangkan dengan optik koheren 400G dan 800G untuk koneksi jarak jauh. Cisco juga menyebut sistem Open Transport 3000 memiliki desain multi-rail yang, menurut perusahaan, mengurangi daya per rail sebesar 75 persen dan kebutuhan ruang rak sebesar 80 persen.
Penerapan scale-across belum mengarah pada satu arsitektur yang disepakati. Cisco membagi cakupannya menjadi penerapan kampus, metro, dan regional, sementara operator masih menguji beragam topologi serta metode pengelolaan lalu lintas. Itamar Gold, direktur manajemen produk Cisco, mengatakan penerapan awal sudah berlangsung, tetapi prosesnya diperkirakan membutuhkan beberapa tahun. Fitur ini disponsori Cisco.


















