Nella corsa per accelerare l'intelligenza artificiale, la società della Silicon Valley Cerebras sta adottando una strategia insolita: andare alla grande.
Mentre un tipico chip per computer ha le dimensioni di un'unghia, Cerebras' chip ha le dimensioni di un piatto da portata.
Il deep learning, una tecnologia di intelligenza artificiale che alimenta gli assistenti vocali, le auto a guida autonoma e i campioni di Go, si basa sulla complessa"rete neurale" software disposto in livelli. I sistemi di deep learning possono essere eseguiti su un singolo computer, ma i sistemi più grandi sono distribuiti su migliaia di macchine connesse, a volte in grandi data center, come quelli gestiti da Google. In un cluster di grandi dimensioni, fino a 48 server delle dimensioni di una scatola di pizza scorrono in rack alti un uomo; Gli scaffali sono allineati in file e riempiono un edificio delle dimensioni di un magazzino. Le reti neurali in questi sistemi possono risolvere problemi scoraggianti, ma devono anche affrontare sfide ovvie. Una rete che prolifera in un cluster è come un cervello sparso in una stanza e connesso tra loro. Gli elettroni si muovono velocemente, ma anche così, la comunicazione tra i chip è lenta e consuma molta energia.
Eric Vishria, un socio accomandatario della società di capitali di rischio di San Francisco Benchmark, si è reso conto per la prima volta del problema quando ha sentito parlare Cerebras Systems, una nuova società di chip per computer, nella primavera del 2016. Benchmark è noto per essere uno dei primi investitori in aziende come Twitter, Uber ed ebay, cioè nel software, non nell'hardware. L'azienda esamina circa 200 start-up all'anno e investe in una."Stavamo giocando a questo gioco di baciare mille rane," Me l'ha detto Vishria. All'inizio del suo discorso, decise di respingere la rana."Ho pensato, perché ho accettato?" Noi'non investiremo in hardware,"ricordò di aver pensato."& #39;è stupido."
Il co-fondatore di Cerebras, Andrew Feldman, ha iniziato con la copertina della diapositiva della sua squadra e ha catturato l'attenzione di Vishria': il suo talento era impressionante. Feldman ha quindi confrontato i due tipi di chip per computer. Innanzitutto, ha esaminato le unità di elaborazione grafica, o GPU, chip progettati specificamente per la creazione di immagini 3D. I sistemi di apprendimento automatico di oggi'si basano su questi chip grafici per una serie di motivi. Successivamente, ha esaminato le unità di elaborazione centrale, o CPU, i chip generici che svolgono la maggior parte del lavoro in un tipico computer."La terza diapositiva riguardava'Gpus,' che in realtà sono un male per l'apprendimento profondo: si dà il caso che siano cento volte migliori delle CPU." Cerebras ha ideato un nuovo tipo di chip che non è progettato per la grafica ma specificamente progettato per l'intelligenza artificiale.
Vishria è abituato ad ascoltare le proposte di aziende che intendono utilizzare il deep learning nella sicurezza informatica, nell'imaging medico, nei chatbot e in altre applicazioni. Dopo il discorso di Cerebras', ha parlato con gli ingegneri di aziende finanziate da Benchmark, tra cui Zillow, Uber e Stitch Fix; Gli hanno detto che stavano avendo problemi con l'IA perché ci voleva troppo tempo per"addestrare" la rete neurale. Google ha iniziato a utilizzare"unità di elaborazione del tensore superveloci," o Tpus, chip speciali progettati per l'intelligenza ARTIFICIALE. Vishria sapeva che era in corso una corsa all'oro e che qualcuno doveva fare i picconi e le pale.
Quell'anno, Benchmark e Foundation Capital, un'altra società di venture capital, ha guidato un round di finanziamento di 27 milioni di dollari per Cerebras, che ha raccolto quasi 500 milioni di dollari. Anche altre aziende stanno realizzando i cosiddetti acceleratori di intelligenza artificiale; Cerebras' i concorrenti groq, Graphcore e Sambanova hanno raccolto più di $ 2 miliardi di capitale insieme. Ma Cerebras' l'approccio è unico. Invece di stampare decine di wafer su un grosso pezzo di silicio, tagliarli e collegarli tra loro, l'azienda ha creato un gigante"wafer level" patata fritta. Mentre un tipico chip per computer ha le dimensioni di un'unghia, Cerebras ha le dimensioni di un piatto da portata ed è il chip per computer più grande del mondo.
Anche i concorrenti hanno trovato l'impresa impressionante."Questa è una nuova scienza," Mi ha detto Nigel Toon, amministratore delegato e co-fondatore di Graphcore'."& #39;è un incredibile pezzo di ingegneria.'un capolavoro." Nel frattempo, un altro ingegnere con cui ho parlato lo ha descritto come un progetto scientifico -- grande per l'amor del'grande. In passato, l'azienda ha provato e non è riuscita a produrre chip giganti; Cerebras' piano equivale a scommettere che superare le sfide ingegneristiche è possibile e ne vale la pena."In tutta onestà, per me l'ignoranza è un vantaggio," ha detto Vishria."Non'non so se sapessi quanto sia difficile fare quello che fanno loro, avrei il coraggio di investire."
È facile dare per scontato che i computer stiano diventando sempre più veloci. Questo è spesso spiegato dalla Legge di Moore': il modello stabilito nel 1965 dal pioniere dei semiconduttori Gordon Moore, secondo il quale il numero di transistor su un chip raddoppia ogni anno o ogni due anni. Naturalmente, la Legge di Moore'non è'in realtà una legge, e gli ingegneri lavorano instancabilmente per ridurre i transistor e allo stesso tempo migliorare l'"architettura" di ogni chip per creare progetti più efficienti e potenti.
Gli architetti di chip si sono a lungo chiesti se un singolo chip per computer su larga scala potesse essere più efficiente di un gruppo di chip più piccoli, proprio come una città con risorse concentrate e blocchi densi è più efficiente di un sobborgo. L'idea è stata sperimentata per la prima volta negli anni '60, quando Texas Instruments ha limitato la produzione di chip larghi pochi pollici. Ma gli ingegneri dell'azienda'incontrarono problemi di rendimento. Su un dato wafer di silicio, i difetti di fabbricazione mettono inevitabilmente in pericolo un certo numero di circuiti. Se un wafer contiene 50 chip, l'azienda può buttare via quelli cattivi e vendere quelli buoni. Ma se ogni chip di successo dipendesse dal circuito funzionante di un singolo wafer, molti wafer costosi verrebbero scartati. Texas Instruments ha trovato una soluzione, ma la tecnologia e la necessità non c'erano ancora.
Negli anni '80, un ingegnere di nome Gene Amdahl tentò di nuovo di risolvere il problema con un'azienda da lui fondata chiamata Trilogy Systems. È diventata la più grande startup nella storia della Silicon Valley' con circa 250 milioni di dollari di finanziamenti. Per risolvere il problema della resa, Trilogy ha stampato componenti ridondanti sul chip. Questo metodo aumenta la produzione ma riduce la velocità del chip. Nel frattempo, Trilogy sta lottando in altri modi. Amdahl ha investito un motociclista con la sua Rolls Royce, causando guai legali; Il suo presidente è morto di tumore al cervello; Le forti piogge hanno ritardato la costruzione di fabbriche, arrugginito i sistemi di condizionamento dell'aria e accumulato polvere sui trucioli. Nel 1984, Trilogy si arrese."Non'non mi rendevo conto di quanto sarebbe stato difficile," Il figlio di Amdahl'ha detto al Times.
Se la tecnologia di Trilogy's ha successo, ora potrebbe essere utilizzata per il deep learning. Invece, le GPU (chip utilizzati nei videogiochi) stanno risolvendo problemi scientifici nei laboratori nazionali. Il riutilizzo delle GPU per l'intelligenza artificiale dipende dal fatto che le reti neurali, sebbene molto complesse, si basano su molte moltiplicazioni e addizioni. Quando i"neuroni" nella rete si sparano a vicenda, si amplificano o si riducono a vicenda i segnali, moltiplicandoli per coefficienti chiamati pesi di connessione. Un efficiente processore AI calcolerà molte attivazioni in parallelo; Li combina in una serie di numeri chiamati vettori, o griglie di numeri chiamati matrici, o blocchi di dimensioni superiori chiamati tensori. Idealmente, vuoi moltiplicare una matrice o un tensore per un altro contemporaneamente. Le GPU sono progettate per fare qualcosa di simile:
& quot;L'ombra di Trilogy è così grande," Feldman mi ha detto di recente,"che le persone smettono di pensare e iniziano a dire,'& #39;è impossibile.'" Le società di GPU, tra cui Nvidia, hanno colto al volo l'opportunità di personalizzare i loro chip per il deep learning. Nel 2015, Feldman e un gruppo di architetti informatici hanno iniziato a discutere l'idea di chip più grandi dopo aver co-fondato un produttore di server per computer, Seamicro, che hanno venduto al produttore di chip AMD per $ 334 milioni. Hanno lavorato sulla questione per quattro mesi in un ufficio preso in prestito da una società di venture capital. Quando hanno avuto una bozza di una soluzione praticabile, hanno parlato con otto aziende; Ho ricevuto finanziamenti da Benchmark, Foundation Capital ed Eclipse e ho iniziato ad assumere.
Cerebras' Il primo compito è risolvere i problemi di fabbricazione che affliggono i chip di grandi dimensioni. Il chip era originariamente un lingotto cilindrico di silicio cristallino di circa un piede di diametro, e il lingotto di acciaio era tagliato in wafer spessi meno di un millimetro. Il circuito viene quindi"stampato" sul wafer attraverso un processo chiamato litografia. Le sostanze chimiche sensibili ai raggi UV vengono depositate con cura sulla superficie, quindi un raggio di luce UV viene proiettato attraverso un modello dettagliato chiamato maschera. Queste sostanze chimiche reagiscono per formare circuiti.
Normalmente, l'area coperta dalla luce proiettata attraverso la maschera diventa un chip. Quindi il chip si muove e la luce viene nuovamente proiettata. Dopo che decine o centinaia di chip sono stati stampati, vengono tagliati al laser dal wafer."Il modo più semplice per farlo è che tua madre tiri fuori un impasto per biscotti rotondo," ha detto Feldman."Ha uno stampo per biscotti e taglia i biscotti con cura." Le leggi della fisica e dell'ottica rendono impossibile realizzare un tagliabiscotti più grande. Di conseguenza,"abbiamo sviluppato una tecnologia in modo che tu possa comunicare attraverso un piccolo impasto tra due biscotti."
Nel sistema di stampa Cerebras sviluppato in collaborazione con TSMC, l'azienda che produce il chip, i bordi dei biscotti si sovrappongono in modo che i loro fili siano collegati. Il risultato è un singolo"dimensione wafer" wafer, quadrato color rame e 21 cm per lato. (Le GPU più grandi hanno un diametro leggermente inferiore a 3 cm.) Cerebras ha prodotto il suo primo chip, Wafer-scale Engine 1, nel 2019. Wse-2, introdotto quest'anno, utilizza un circuito più denso, con 2,6 trilioni di transistor confezionati in 850.000 unità di elaborazione , o"core". (Le migliori GPU hanno solo poche migliaia di core, mentre la maggior parte delle CPU ne ha meno di 10.)
& quot;2.6 trilioni di transistor è stupefacente," ha affermato Aart de Geus, presidente e co-CEO di Synopsys. Synopsys fornisce alcuni software che Cerebras e altri produttori di chip utilizzano per realizzare e convalidare i loro progetti di chip. De Geus afferma che quando progettano i chip, gli ingegneri devono prima considerare due domande fondamentali:"Da dove provengono i dati?" Dove viene gestito?" Quando i chip erano più semplici, i designer potevano rispondere a queste domande con una matita su un tavolo da disegno; Quando lavori con i chip più complessi di oggi', inserisci il codice che descriva l'architettura che vogliono creare, quindi passa agli strumenti di visualizzazione e codifica."Pensa a come appare la casa dal tetto," de Geus ha detto."Il garage è vicino alla cucina? O è vicino alla camera da letto? Lo vuoi vicino alla cucina, altrimenti'dovrai portare la spesa in ogni angolo della casa." Dopo aver progettato la planimetria, ha spiegato,"puoi usare le equazioni per descrivere cosa sta succedendo nella stanza."
La complessità del design dei chip è sbalorditiva."Ci sono molti livelli qui," de Geus ha detto, con circuiti incrociati e stratificati uno sopra l'altro, come un grande cavalcavia autostradale. Per gli ingegneri di Cerebras, lavorando sulla scala di un wafer, la complessità è aumentata. Sinossi' il software aiuta sotto forma di intelligenza artificiale: algoritmi di pattern matching identificano problemi comuni e propongono soluzioni; Il programma di ottimizzazione sposta la stanza in una disposizione più rapida ed efficiente. Se troppe corsie tentano di infilarsi in un edificio a due blocchi, il software consente agli ingegneri di interpretare Robert Moses e spostare il blocco.
Alla fine, afferma Feldman, ci sono diversi vantaggi nei progetti di chip sovradimensionati. Quando i nuclei sono sullo stesso chip, comunicano più velocemente: il cervello del computer'ora è concentrato in un singolo teschio, piuttosto che sparpagliato in una stanza. I chip più grandi gestiscono anche meglio la memoria. In genere, un piccolo chip pronto per elaborare un file deve prima ottenere il file da un chip di memoria condivisa situato in un'altra posizione sulla scheda del circuito; Solo i dati più comunemente usati vengono memorizzati nella cache più vicino a casa. Nel descrivere l'efficienza dei chip a livello di wafer, Feldman ha offerto un'analogia: mi ha chiesto di immaginare un gruppo di coinquilini (core) che vivevano in un dormitorio (chip) che volevano guardare una partita di calcio (lavorare con i computer). Per guardare la partita, dice feldman, i coinquilini devono conservare la birra in frigorifero (i dati vengono archiviati in memoria); Cerebras tiene un frigorifero in ogni stanza così i coinquilini non devono rischiare di andare nella cucina comune del dormitorio's o Safeway. Ciò ha l'ulteriore vantaggio di consentire a ciascun core di elaborare dati diversi più rapidamente."Così posso avere Bud nella mia stanza del dormitorio," ha detto Feldman."Nel tuo dormitorio, puoi avere Schlitz."
Infine, Cerebras deve superare i problemi di resa. Gli ingegneri dell'azienda'usano il trucco di Trilogy': la ridondanza. Ma qui hanno un vantaggio sui loro predecessori. Trilogy cerca di creare chip generici con molti componenti diversi, quindi il cablaggio attorno a un singolo componente guasto potrebbe richiedere il collegamento a un sostituto distante. Su Cerebras' chip, tutti i core sono identici. Se un biscotto è sbagliato, quelli intorno sono altrettanto buoni.








