تیز رفتار آپٹیکل انٹرکنیکٹ: ڈیٹا سینٹر حل
Apr 27, 2026| پچھلی سہ ماہی میں ہمارے پاس ایک کسٹمر شپ واپس چالیس 400G DR4 ماڈیولز تھے جو ان کے Arista 7060X5 سوئچز پر بے ترتیب لنک فلیپس کا دعوی کرتے تھے۔ اس سے پہلے کہ ہم RMA پیپر ورک کھولیں، ہمارے ٹیسٹ انجینئر نے ایک سوال پوچھا: کیا آپ نے اس کا معائنہ کیا۔ایم پی او کنیکٹرتنصیب سے پہلے؟ ان کے پاس نہیں تھا۔ ہم نے اپنے مکمل رجعت کے ذریعے ماڈیول بھیجے، آنکھوں کے خاکے صاف، BER 1E-13 سے نیچے چاروں لین میں،ڈی ڈی ایم ریڈنگز برائے نام. پھر ہم نے ان سے کہا کہ وہ اپنے ٹرنک کیبل کے اختتام-چہروں کی تصاویر فائبر مائکروسکوپ کے نیچے بھیجیں۔ ہر ایک کنیکٹر میں ذرات کی آلودگی تھی۔ چالیس ماڈیولز، صفر نقائص۔ مسئلہ خاک کا تھا۔
ہم ہر ماہ اس کا کوئی نہ کوئی ورژن دیکھتے ہیں۔ کسی بھی پیمانے پر تیز رفتار آپٹیکل انٹر کنیکٹ کی تعیناتی ایک ہی دیوار سے ٹکراتی ہے، اور تعداد اس کا بیک اپ لے لیتی ہے: کہیں کہیں تمام 400G اور 800G لنک کی ناکامیوں میں سے 65% اور 70% کے درمیان ٹرانسیور کی خرابیوں کی بجائے کنیکٹر کی آلودگی کا پتہ لگاتا ہے۔ (IEEE 802.3 فیلڈ ڈیٹا بذریعہ AscentOptics) ہم اسے سب سے پہلے سامنے لاتے ہیں کیونکہ یہ اس بات کا تعین کرتا ہے کہ ہم پورے انٹر کنیکٹ فیصلے کے بارے میں کیسے سوچتے ہیں۔ ماڈیول تقریبا کبھی بھی کمزور ترین لنک نہیں ہوتا ہے۔ اس کے ارد گرد جسمانی تہہ ہے۔

آپ کا ٹریفک پیٹرن آپ کے آپٹیکل انٹر کنیکٹ فن تعمیر کا فیصلہ کرتا ہے۔
ہر کوئی حصہ نمبر سے شروع ہوتا ہے۔QSFP-DD یا OSFP، SR یا DR، ملٹی موڈ یا سنگل-موڈ۔ ہم بھی کرتے ہیں۔ لیکن تعیناتیاں جو ہمارے صارفین کے لیے اچھی تھیں وہ سب کہیں اور شروع ہوئیں: ٹریفک دراصل کیسی نظر آتی ہے؟
بڑے-پیمانے کی AI ٹریننگ تمام-سے-GPU کمیونیکیشن تیار کرتی ہے جو منٹوں سے گھنٹوں کے اوقات میں حیرت انگیز طور پر پیش گوئی کی جا سکتی ہے۔ گوگل اپنے مشتری نیٹ ورک میں آپٹیکل سرکٹ سوئچز کے ساتھ اس کا فائدہ اٹھاتا ہے، پیکٹوں کو سوئچ کرنے کے بجائے ریک کے درمیان جسمانی روشنی کے راستوں کو دوبارہ ترتیب دیتا ہے۔ پیداوار کے ایک دہائی کے استعمال سے ان کے شائع شدہ نتائج: 41% پاور میں کمی، 30% کم کیپیکس، اور فیبرک اپ ٹائم میں 50x بہتری بمقابلہ ان کے سابقہ Clos فن تعمیر۔ (گوگل SIGCOMM'22) وہ نمبر حقیقی ہیں، لیکن ان کا تعلق ایک کمپنی سے ہے جس نے پانچ سالوں میں OCS انفراسٹرکچر پر $500 ملین اور $1 بلین کے درمیان خرچ کیا۔ ہمارے پاس مٹھی بھر درمیانے-سائز کے صارفین ہم سے اپنے ماحول کے لیے OCS کی فزیبلٹی کا جائزہ لینے کے لیے کہتے ہیں۔ ہر معاملے میں، ایک بار جب وہ ذیلی-500 نوڈ اسکیل پر نمبر چلاتے ہیں، تو سرمائے کے تقاضے ری کنفیگریشن کے فوائد سے زیادہ ہوتے ہیں، اور وہ پلگ ایبل ماڈیولز کا استعمال کرتے ہوئے روایتی اسپائن لیف کے ساتھ رہے۔
انفرنس مساوات کو پلٹ دیتا ہے۔ بہاؤ کی سطح پر ٹریفک پھٹا اور غیر متوقع ہے، اور تاخیر برداشت صفر کے قریب ہے۔ آپ فی-درخواست کی بنیاد پر آپٹیکل راستوں کو دوبارہ ترتیب نہیں دے سکتے۔ آپ کو جس چیز کی ضرورت ہے وہ مستقل طور پر زیادہ پروویژن شدہ فیبرک ہے جس میں تعییناتی تاخیر ہوتی ہے، جو آپ کو ریڑھ کی ہڈی کے-لیف ٹوپولوجی میں پلگ ایبل ٹرانسسیور کی طرف دھکیلتا ہے جہاں ہر لنک ہمیشہ روشن رہتا ہے۔ ہم دونوں منظرناموں میں ماڈیول فروخت کرتے ہیں، اور انجینئرنگ کی گفتگو بالکل مختلف ہوتی ہے۔ ٹریننگ کلسٹر خریدار مجموعی بینڈوڈتھ فی ریک اور پاور فی بٹ کے بارے میں جاننا چاہتے ہیں۔ اندازہ کے خریدار پونچھ میں تاخیر کے بارے میں پوچھتے ہیں اور جب لنک نیچے جاتا ہے تو کیا ہوتا ہے۔

ہائپر اسکیل سے نیچے روایتی انٹرپرائز اور کولو ماحول کے لیے، فی پورٹ لاگت غالب ہے اور موجودہ فائبر پلانٹ کے ساتھ پسماندہ مطابقت خام بینڈوتھ کی کثافت سے زیادہ اہمیت رکھتی ہے۔ ہم نے اپنا تجربہ کیا ہے۔400G QSFP-14 سوئچ پلیٹ فارمز میں DD ماڈیولزبشمول Cisco Nexus 93600CD، Arista 7060X5، اور Juniper QFX5220۔ ان ماحول میں، غالب تشویش رفتار نہیں ہے. یہ ہے کہ آیا ماڈیول کو مینوئل اوور رائڈ کمانڈز کے بغیر سوئچ فرم ویئر سے پہچانا جاتا ہے۔
800G ڈیڈ زون جو انجینئرز کو آف گارڈ پکڑتا ہے۔
400G پر، آپس میں جڑنا ایک دو-مرحلہ عمل تھا: فاصلے کی پیمائش کریں، تانبے یا فائبر کا انتخاب کریں۔ غیر فعال DAC نے آرام سے 3 سے 5 میٹر کا احاطہ کیا. 800G نے اسے توڑ دیا۔ ہر لین 112G PAM4 چلاتی ہے۔ ان فریکوئنسیوں پر تانبے کا نقصان 400G کے مقابلے میں تقریباً دگنا ہو جاتا ہے، اور نتیجہ غیر فعال کیبل کے لیے 2 میٹر کے ارد گرد سخت چھت ہے۔

ہم نے یہ مہنگا طریقہ سیکھا۔ ایک ابتدائی گاہک نے ہمارا آرڈر دیا۔800G غیر فعال DAC اسمبلیاںان کے 400G ریک لے آؤٹ کی بنیاد پر 3 میٹر کی لمبائی میں۔ 60% سے زیادہ بندرگاہوں پر لنک ٹریننگ ناکام ہو گئی۔ تانبا عیب دار نہیں تھا؛ طبیعیات صرف اس کی اجازت نہیں دے گی۔ انہوں نے 3 سے 5 میٹر کی دوڑ اور اس سے آگے ہر چیز کے لیے پلگ ایبل آپٹیکل ماڈیولز کے لیے AEC میں سوئچ کیا، اور تعیناتی ایک ہفتے کے اندر مستحکم ہو گئی۔ تب سے، ہم نے 2.5 میٹر سے اوپر کے غیر فعال 800G DAC کے آرڈر لینا بند کر دیا ہے اور اپنے آرڈر کی تصدیق کے عمل میں ایک تعیناتی فاصلے کی ایڈوائزری شامل کر دی ہے۔
AEC اب 3 سے 7 میٹر کے فرق کا مالک ہے۔. ڈیجیٹل ری ٹائمرز بغیر آپٹیکل کنورژن کے برقی طور پر سگنل کو دوبارہ تخلیق کرتے ہیں، جو لاگت کو کم رکھتا ہے لیکن تاخیر میں اضافہ کرتا ہے۔ KP4 FEC اکیلے 800G پر ہر ہاپ پر 50 سے 100 نینو سیکنڈ لگاتا ہے، اور ریٹیمر سب سے زیادہ اسٹیک کرتا ہے۔ ہم نے AEC اسمبلیوں پر 85 سے 110 ns پر کل اضافی تاخیر کی پیمائش کی جو ہم فی الحال بھیجتے ہیں۔ ریڑھ کی ہڈی{10}}لیف فیبرک لنکس کے لیے، وہ اوور ہیڈ ایپلیکیشن کی کارکردگی میں پوشیدہ ہے۔ مضبوطی سے جوڑے ہوئے GPU کلسٹرز کے لیے یہ ایک الگ کہانی ہے۔ H100 نوڈس پر چلنے والے تین کسٹمر ڈیپلائمنٹس کے پروفائلنگ ڈیٹا کی بنیاد پر، اگر آپ کی ٹریننگ جاب کا کمیونیکیشن اوور ہیڈ پہلے سے ہی 15% سے اوپر ہے، تو NCCL AllReduce آپریشنز میں ایک سے زیادہ سوئچ ٹائرز پر اضافی سو نینو سیکنڈ فی ہاپ کا مرکب ہونا شروع ہو جاتا ہے۔
7 میٹر سے آگے، 800G کے لیے پلگ ایبل آپٹیکل ٹرانسسیورز واحد قابل عمل راستہ ہیں۔ جسمانی پرت یہاں کافی سخت ہونے کا مطالبہ کرتی ہے۔ IEEE 802.3ck کے تحت ختم-سے-اختتام کے نقصان کے بجٹ زیادہ تر 800G تک رسائی کی کلاسوں کے لیے 1.5 dB سے نیچے ہیں، اور ہر میٹڈ MPO کنکشن 0.35 dB سے کم رہنا چاہیے۔ ہم نے انسٹال شدہ فائبر دیکھا ہے جس نے 100G پر سرٹیفیکیشن پاس کیا ہے PMD کی اقدار کو کیبل ٹرے میں کئی سالوں کے کمپریشن کے بعد اس کی درجہ بندی کی تفصیلات سے دو سے تین گنا زیادہ دکھاتا ہے، جو 2023 میں جونیپر کی نیٹ ورک ریسرچ ٹیم کی رپورٹ کے مطابق ہے۔ کسی بھی 800G ٹرانسیور کی تعیناتی سے پہلے ہماری معیاری سفارش: OTDR اور PMD کی موجودہ سی ایم ڈی کیریکٹر پر چلائیں نمونہ نہیں۔ ہر طبقہ۔ دو ٹرنک کیبلز کو دوبارہ کھینچنے کی قیمت چھ ماہ کے وقفے وقفے سے لنک فلیپس کو ڈیبگ کرنے کی لاگت کا ایک حصہ ہے۔
CPO بمقابلہ LPO بمقابلہ پلگ ایبل: جہاں ہر ٹیکنالوجی اصل میں 2026 میں کھڑی ہے
کو-پیکیجڈ آپٹکس تبدیل کر دے گا کہ ڈیٹا سینٹر سوئچنگ انفراسٹرکچر کیسے بنایا جاتا ہے۔ ہم اسے ایک پلگ ایبل ماڈیول بنانے والے کے طور پر کہتے ہیں، اس لیے ہمارے نقطہ نظر کو غیر جانبدار کے بجائے باخبر سمجھیں۔
OFC 2026 میں، CPO پروٹوٹائپس پر قابل اعتماد ڈیٹا نے ناکامی کی شرح روایتی پلگ ایبل ماڈیولز سے ممکنہ طور پر کم ظاہر کی۔ مکینیکل اندراج کے چکروں یا بے نقاب کنیکٹر سطحوں کے بغیر، پلگ ایبل ماڈیولز کے غالب ناکامی کے طریقے صرف لاگو نہیں ہوتے ہیں۔ Broadcom کے Bailly 51.2T CPO سوئچ پلیٹ فارم نے مساوی پلگ ایبل کنفیگریشنز کے مقابلے آپٹیکل لیئر پر تقریباً 70% کم پاور ڈرا کا مظاہرہ کیا۔ (ڈیٹا مائنٹیلیجنس آپٹیکل انٹر کنیکٹ رپورٹ) NVIDIA نے 2027 سے 2028 ونڈو میں GTC 2026 ہدفی پیمانے پر CPO-انٹیگریٹڈ سوئچز-تعینات کو دکھایا۔
ہماری پوزیشن: اگر آپ اپنی مرضی کے مطابق سوئچ سلیکون بنانے والے ہائپر اسکیلر نہیں ہیں، تو کم از کم 2027 تک پلگ ایبل آپٹکس ہی آپ کے لیے قابل استعمال آپشن ہیں۔ CPO کو بورڈ کے آرکیٹیکچرز کی ضرورت ہے جو زیادہ تر سوئچ وینڈرز نے ابھی تک نہیں بھیجے ہیں، کنیکٹر کے معیارات جو حتمی نہیں ہوئے ہیں، اور ناکامیوں سے نمٹنے کے لیے ایک بالکل نئی پلے بک جسے آپ ماڈیول کھینچ کر ٹھیک نہیں کر سکتے۔ جنرل انٹرپرائز پروکیورمنٹ کے لیے ماحولیاتی نظام ابھی موجود نہیں ہے۔ ہمارے پاس پچھلے سال دو ممکنہ کسٹمرز نے CPO کے انتظار میں اپنے 400G-سے-800G اپ گریڈ میں تاخیر کی۔ دونوں بالآخر واپس آگئے اور ان کے بینڈوتھ کے فرق کے پیداواری واقعات بننے کے بعد پلگ ایبل آرڈرز دیے گئے۔ ہم نے اس پوزیشن کے لیے انجینئرنگ کے استدلال کے بارے میں مزید تفصیل سے لکھا ہے۔پلگ ایبل ٹرانسیور فن تعمیر کا تجزیہ.
LPO ایک مختلف جگہ پر بیٹھتا ہے۔ ماڈیول سے DSP کو ہٹانے سے واحد سب سے زیادہ پاور-ہنگری کمپوننٹ ختم ہو جاتا ہے، جو کل ماڈیول پاور ڈرا کے نصف تک کے لیے ذمہ دار ہے۔ نتیجہ 30 سے 50٪ کم کھپت اور 15 نینو سیکنڈ تک کم تاخیر ہے۔ ہم نے 2025 کے آخر میں LPO-مخصوص RFQs کو فیلڈ کرنا شروع کیا۔ چار میں سے تین NVIDIA سپیکٹرم-X پر سنگل-وینڈر GPU کلسٹرز بنانے والے صارفین سے آئے۔ کوئی بھی آپریٹڈ ملٹی وینڈر فیبرکس نہیں، جو آپ کو سب کچھ بتاتا ہے کہ LPO آج کہاں کام کرتا ہے۔ اگر آپ کا نیٹ ورک سوئچ وینڈرز کو ملاتا ہے، تو LPO آپ کے ماحول سے مطابقت نہیں رکھتا ہے۔ اگر آپ ایک وینڈر AI کلسٹر چلاتے ہیں، تو یہ دستیاب بہترین اپ گریڈ ہو سکتا ہے، اور ہم 2027 کے وسط تک LPO-ماڈیولز کو قابلیت میں تیار کرنے کی توقع رکھتے ہیں۔
ماڈیول کے انتخاب کے لیے 800G تھرمل مارجن کا کیا مطلب ہے۔
800G پر تھرمل ریاضی لوگوں کو چوکس کر دیتی ہے۔ اس جنریشن میں تیز رفتار آپٹیکل انٹر کنیکٹ پاور ڈینسٹی ایسے مسائل پیدا کرتی ہے جو 400G پر موجود ہی نہیں تھے۔ 16W پر 800G ماڈیولز کے ساتھ مکمل طور پر بھرا ہوا ایک 64-پورٹ سوئچ ASIC کے اپنے 400 سے 500W سوئچ کرنے سے پہلے، صرف ٹرانسیور پاور میں تقریباً 1kW کھینچتا ہے۔ یہ 1.4 سے 1.5 کلو واٹ فی سوئچ ہے۔ ریڑھ کی پرت میں آٹھ سوئچ آپ کو صرف نیٹ ورک کے آلات سے 11 کلو واٹ سے زیادہ رکھتے ہیں، ریکوں میں جو اکثر 8 سے 10 کلو واٹ کے لیے فراہم کیے جاتے تھے۔
جونیپر نیٹ ورکس واضح طور پر خبردار کرتا ہے کہ ہائی پاور ڈرا والے تھرڈ پارٹی ماڈیولز، خاص طور پر مربوط ZR اور ZR+ اقسام، میزبان آلات کو تھرمل نقصان پہنچا سکتے ہیں، جس کی ذمہ داری صارف پر پڑتی ہے۔ (Juniper Networks 800G Optics FAQ) یہ فریق ثالث آپٹیکل ماڈیولز کے خلاف کوئی دلیل نہیں ہے۔ یہ یہ جاننے کی دلیل ہے کہ آپ بالکل کیا پلگ ان کر رہے ہیں۔ ہماری تھرمل سائیکلنگ کی اہلیت میں، ہم ہر 800G ماڈیول ڈیزائن کو 85 ڈگری جنکشن درجہ حرارت پر 2,000 گھنٹے تک جانچتے ہیں اور بنیادی عمر بڑھنے کے اشارے کے طور پر لیزر بائیس کرنٹ ڈرفٹ کو ٹریک کرتے ہیں۔ اکائیاں جو 38 ایم اے سے اوپر جاتی ہیں وہ پروڈکشن لائن سے کھینچ لی جاتی ہیں۔ 800G کثافت پر، ماڈیول ڈرائنگ 14W اور ایک ڈرائنگ 18W کے درمیان فرق اس بات کا تعین کرتا ہے کہ آیا ریک تھرمل لفافے کے اندر رہتا ہے یا 2 AM پر شٹ ڈاؤن الارم کو متحرک کرتا ہے۔ قیاس آرائی کا غلط ہونا ہمیشہ پریشان کن رہا ہے۔ ان پاور لیولز پر، یہ مہنگا ہے۔

ہم پلگ ایبل ماڈیولز 1G SFP سے 800G OSFP کے ذریعے بھیجتے ہیں، اور ہم بڑے سوئچ پلیٹ فارمز کے خلاف ٹیسٹ کرتے ہیں۔ ہم ریکارڈ رکھتے ہیں کہ کیا کام کرتا ہے اور کیا نہیں۔ اگر آپ کو کسی مخصوص سوئچ ماحول کے خلاف مطابقت کی جانچ کی ضرورت ہے، یا ہائی-کثافت والے 800G ریک کے لیے تھرمل اور پاور-کلاس اسپیکس چاہتے ہیں، تو ہمارے انجینئرز ہر ہفتے وہ گفتگو چلاتے ہیں۔ ہماری800G OSFP اور QSFP-DD800 ٹرانسیور صفحہہمارے پاس بھیجنے والے ہر ماڈیول کے لیے چشمی، رسائی-کلاس کے اختیارات، اور نمونے کی درخواست کے فارم ہیں۔


