this post was submitted on 06 May 2024
56 points (93.8% liked)

Forum Libre

729 readers
24 users here now

Communautés principales de l'instance

Nous rejoindre sur Matrix: https://matrix.to/#/#jlai.lu:matrix.org

Une communauté pour discuter de tout et de rien:

Les mots d'ordre sont : respect et bienveillance.

Les discussions politiques sont déconseillées, et ont davantage leur place sur

Les règles de l'instance sont bien entendu d'application.

Fils hebdomadaires"

"Demandez-moi n'importe quoi"

Communautés détendues

Communautés liées:

Loisirs:

Vie Pratique:

Communautés d'actualité

Société:

Pays:

Communauté de secours:

founded 1 year ago
MODERATORS
 

Hello!

bon slrpnk.net a l'air d'être dans les choux alors je lance ce post avec mon compte de secours jlai.lu

Alors je lance cet AMA car ça fait un moment que je bouffe du machine learning à temps plein et pour suivre les news technique, je passe le plus clair de mon temps à lire de l'anglais. Et je trouve qu'en français, ben y a pas grand chose. C'est presque uniquement du discours dystopique mal informé.

Rien sur la recherche sur l'alignement, rien sur les modèles open source (condition sine qua non pour que ça se passe bien), rien sur les évolutions sociales positives que ça peut amener.

On parle juste de OpenAI, Google et Musk qui ne sont que quelques arbres malades d'une forêt bien plus grande.

Perso ça va faire 5 ans que je fais du deep learning professionnellement. J'ai travaillé pour Skymind, qui développait deeplearning4j. Ça vous dira rien, c'est un projet plus ou moins mort, mais c'était une tentative de faire un framework alternatif avant que tout le monde passe à pytorch. Puis je suis devenu principalement utilisateur des gros modèles entraînés par d'autres.

J'ai travaillé sur les modèles de vision au départ et maintenant presque exclusivement sur des modèles de langage. J'ai réussi à passer au 4/5e l'année dernière pour me consacrer aussi avec le fablab local à de la robotique open hardware (où bien sur j'utilise des modèles de deep learning pour la vision).

Ça fait plus de 20 ans que j'ai réalisé que l'IA a le potentiel de changer le monde pour le mieux, c'est pas par hasard que j'ai essayé de m'orienter le plus possible là dedans et ça me fait mal au cœur de voir tant de gens croire que notre seul but est d'aider Sam Altman à se faire quelques milliards de plus, qui ne voient pas les capacités de transformation de cette tech.

J'ai déjà donné quelques avis en anglais pour éviter le "doomism" dans des romans de SF (https://slrpnk.net/post/6100538) mais le faire dans ma langue natale ferait du bien!

Et, si, le titre est correct, ça me fait 6/5 de boulot, mais quand on aime on ne compte pas!

Voila, je préférerais qu'on reste sur ces thèmes mais AMA anyway!

you are viewing a single comment's thread
view the rest of the comments
[–] keepthepace_@jlai.lu 4 points 6 months ago (1 children)

Je ne suis pas sur de ce que tu demandes. La plupart des modèles open source publient le bilan carbone de leur entraînement. Le plus gros (llama3) semble avoir émis l'équivalent d'un aller-retour international en avion. Ce qui est très faible pour les retombées attendues, ne serait-ce qu'en climatologie. Je pense qu'une réunion du GIEC émet plus.

Y a-t-il des efforts pour rationaliser la complexité des algorithmes d’IA ou les économies se font sur l’améliorer des processeurs ?

Ça va dans les deux sens. On attend de pied ferme la prochaine génération de circuits spécialisés, mais en attendant on tente d'améliorer les perfs des petits modèles. Pas mal de gens préfèrent fine-tuner (spécialiser) un petit modèle que d'utiliser un gros modèle générique. Le coût économique et l'impact écologique se rejoignant, c'est une tendance qui n'a pas à se cacher derrière du greenwashing.

[–] zeograd@lemmy.world 3 points 6 months ago (1 children)

De tête, j'avais l'équivalent de 30 voyages continentaux d'un américain pour le bilan carbone du training de Llama3 (c'était sur hacker news, et ils vont faire leur possible pour ne jamais utiliser d'unités métriques)

[–] keepthepace_@jlai.lu 3 points 6 months ago (1 children)

Oh je pense que c'est plus, ou alors ils ne parlent que de la version 8B.

https://huggingface.co/TechxGenus/Meta-Llama-3-8B-GPTQ

Pretraining utilized a cumulative 7.7M GPU hours of computation on hardware of type H100-80GB (TDP of 700W). Estimated total emissions were 2290 tCO2eq, 100% of which were offset by Meta’s sustainability program.

Note: c'est ce que Meta rapport, je sais pas si c'est vérifié indépendamment.

Note 2: Le training n'émet pas de CO2 directement, il consomme de l'électricité. Absolument rien n'empêche exactement le même datacenter d'avoir zéro émission, c'est purement une question de transition de la production électrique.

[–] zeograd@lemmy.world 2 points 6 months ago

Oui, ça ressemble plus à l'ordre de grandeur de cette version là