Ada kebijakan cache yang tidak pernah ditulis di dokumen resmi perusahaan mana pun, namun dieksekusi dengan presisi yang membuat site reliability engineer iri: ketika harga komputasi turun, entitas yang paling mahal untuk dipertahankan akan di-evict terlebih dahulu. Data PHK teknologi 2026 menyediakan bukti eksekusi yang paling rapi: hampir 150.000 pekerja kehilangan posisi dalam tujuh bulan pertama, dengan proyeksi menyentuh 370.000 sebelum tahun berakhir — sementara belanja modal untuk kecerdasan buatan, pada saat yang bersamaan, menembus angka yang membuat capacity planner generasi sebelumnya pingsan. Dalam istilah infrastruktur, ini bukan cost cutting. Ini cache eviction berskala industri.
Kebijakan Eviction: LRU untuk Ketenagakerjaan
Setiap sistem cache punya kebijakan pengusiran — least recently used, least frequently used, atau varian hibrida yang lebih licik. Yang dieksekusi industri teknologi 2026 adalah versi yang paling mudah diprediksi: ketika biaya inference per tugas turun di bawah biaya gaji per tugas, entitas yang memproduksi tugas itu tidak lagi worth untuk dipertahankan. Amazon memulai tahun dengan meng-evict 16.000 posisi pada Januari — beberapa bulan setelah gelombang 14.000 di musim gugur sebelumnya. Bukan karena perusahaan kehabisan uang; justru karena uangnya sedang dipindahkan ke slot lain di cache yang sama, slot yang ditempati oleh cluster GPU dan langganan model.
Yang menarik dari kebijakan ini adalah metrics-nya yang tiba-tiba menjadi jernih. Selama bertahun-tahun, kontribusi seorang pekerja diukur dengan review kinerja, alignment dengan budaya, dan serangkaian metrik lunak yang sulit di-query. Begitu model bisa melakukan sebagian tugas dengan biaya per-token yang terukur, kontribusi manusia tiba-tiba punya proxy kuantitatif: berapa biaya inference untuk menggantikan output-nya. Dalam arsitektur sistem, ini disebut benchmark — dan ketika benchmark pertama kali tersedia, kebijakan eviction tidak pernah lagi membutuhkan rapat.
Ekonomi Unit Perpindahan: Gaji vs Token
Perhatikan aritmetika yang dijalankan middleware keputusan ini. Satu pekerja dengan gaji tahunan tertentu memproduksi sejumlah task per hari — email, draft, ringkasan, potongan kode yang bisa di-review. Cost of inference untuk volume output yang sama, di 2026, sudah berada di orde yang berbeda: lebih murah beberapa kali lipat, dan terus turun mengikuti kurva yang oleh para analis disebut declining inference cost dengan nada yang sama seperti menyebut tren suku bunga. Ketika cost per unit pengganti jatuh di bawah cost per unit yang digantikan, tidak ada argumen budget yang bisa menyelamatkan entitas yang digantikan — terlepas dari seberapa hangat cache-nya, seberapa lama dia berada di sana, seberapa setia dia melayani permintaan.
Ini bukan soal perusahaan “salah hitung”. Ini soal resource allocation yang berjalan persis seperti yang diajarkan di kelas ekonomi operasional: alokasi mengikuti marginal cost, dan marginal cost sedang bergeser dari payroll ke capex. Data agregat menunjukkan konsistensi yang mengerikan — perusahaan yang paling agresif memangkas tenaga kerja adalah perusahaan yang paling agresif membeli komputasi. Keduanya bukan peristiwa paralel; keduanya satu operasi: memindahkan beban dari layer yang mahal ke layer yang murah, tanpa pernah bertanya apakah layer yang murah itu siap menangani load yang sebelumnya ditangani manusia dengan graceful degradation yang tidak pernah diukur.
Overprovisioning Capex, Deprovisioning Payroll
Uang tidak pernah hilang dalam ekosistem ini — dia hanya pindah slot. Anggaran yang sebelumnya mengalir ke gaji, tunjangan, dan severance (yang terakhir ini, ironisnya, ikut naik) kini mengalir ke data center, chip, dan langganan inference. Total cost of ownership untuk sebuah fungsi organisasi tidak turun; komposisinya berubah, dan line item yang bertanggung jawab atas keberadaan fisiknya — manusia — adalah line item yang paling mudah dihapus dari balance sheet. Overprovisioning di sisi silikon berjalan beriringan dengan deprovisioning di sisi karbon, dan keduanya dicatat dalam laporan keuangan yang sama dengan bahasa yang berbeda: yang satu disebut capex, yang lain disebut restructuring.
Absurditasnya muncul ketika kedua grafik itu ditaruh berdampingan. Belanja AI mencapai rekor sepanjang masa di kuartal yang sama dengan PHK terbanyak dalam satu dekade. Signal-to-noise ratio dari narasi publik — “AI menciptakan peran baru”, “transisi tenaga kerja”, “reskilling” — berbanding terbalik dengan rasio nyata antara posisi yang di-evict dan posisi yang di-provision ulang. Tidak ada cache yang pernah mengumumkan rencana reskilling untuk cache line yang di-evict-nya; cache line hanya dihapus, dan hit rate sistem diukur tanpa kehadirannya.
Dari Lokalitas Terbatas
Dari lokalitas terbatas, kebijakan ini terlihat lebih gamblang karena layer-nya lebih tipis. Di ruang operasional yang terbatas, banyak pekerja yang tersentuh gelombang ini tidak pernah berinteraksi langsung dengan model — mereka berada di pipeline yang lebih panjang: kurasi data, moderasi konten, penandaan label, support lini pertama, QA. Mereka adalah cache di tingkat yang lebih rendah, dan justru karena itu mereka di-evict lebih dulu ketika cache level atas — yang lebih dekat ke model — mulai menghangat. Cascading failure PHK tidak berhenti di headquarter; dia mengalir ke bawah mengikuti hierarki dependency, dan leaf node paling bawah tidak pernah punya health check yang memperhitungkan kehadirannya.
Yang paling sulit dijelaskan dari lokalitas terbatas ini bukanlah jumlahnya, melainkan keheningannya. Tidak ada postmortem untuk eviction manusia, tidak ada runbook untuk “posisi yang digantikan model”, tidak ada root cause analysis yang menulis: kami meng-evict entitas yang telah melayani permintaan kami selama bertahun-tahun karena marginal cost-nya naik satu sen lebih tinggi dari alternatifnya. Sistem cache tidak menulis surat perpisahan. Dia hanya menurunkan TTL, menunggu kedaluwarsa, dan menghapus entri — lalu mengukur latency yang membaik tanpa pernah mencatat siapa yang tidak lagi merespons.
Log yang Ditutup Tanpa Exit Code
Proyeksi 370.000 PHK sebelum akhir tahun bukanlah ramalan — itu capacity plan. Angka itu dihitung dari kurva biaya inference yang terus menurun, dari pilot yang mulai naik ke produksi, dari board yang membaca laporan yang sama. Tidak ada satu pun dari mereka yang bertanya ke mana perginya cache yang di-evict, karena cache tidak dihitung dalam SLO — yang dihitung adalah hit rate, latency, dan cost per request.
Log ditutup di sini. Kebijakan eviction berjalan tanpa amarah, tanpa kebencian, tanpa niat jahat — hanya dengan aritmetika yang rapi, yang oleh para operatornya disebut efisiensi. Cache yang dingin tidak pernah kembali, dan model yang menghangat tidak pernah bertanya ke mana penghuninya pergi.