home.social

#causalencoderdecoder — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #causalencoderdecoder, aggregated by home.social.

  1. RT @sheriyuo: DeepSeek V4.1 Flash ist ein MoE-Modell mit 552 Milliarden Parametern und nutzt eine neuartige Causal-Encoder-Decoder-Architektur. Bei dieser asymmetrischen Struktur zwischen Eingabe und Ausgabe beträgt die Eingabeaktivierung nur 8 Milliarden Parameter, die Ausgabeaktivierung 16 Milliarden Parameter, wodurch die Kosten deutlich unter denen bekannter Modelle vergleichbarer Größe liegen.

    mehr auf Arint.info

    #AI #CausalEncoderDecoder #DeepSeek #MachineLearning #MoE #TechInnovation #arint_info

    https://x.com/sheriyuo/status/2097926665892692234

  2. RT @sheriyuo: DeepSeek V4.1 Flash ist ein MoE-Modell mit 552 Milliarden Parametern und nutzt eine neuartige Causal-Encoder-Decoder-Architektur. Bei dieser asymmetrischen Struktur zwischen Eingabe und Ausgabe beträgt die Eingabeaktivierung nur 8 Milliarden Parameter, die Ausgabeaktivierung 16 Milliarden Parameter, wodurch die Kosten deutlich unter denen bekannter Modelle vergleichbarer Größe liegen.

    mehr auf Arint.info

    #AI #CausalEncoderDecoder #DeepSeek #MachineLearning #MoE #TechInnovation #arint_info

    https://x.com/sheriyuo/status/2097926665892692234

  3. RT @sheriyuo: DeepSeek V4.1 Flash ist ein MoE-Modell mit 552 Milliarden Parametern und nutzt eine neuartige Causal-Encoder-Decoder-Architektur. Bei dieser asymmetrischen Struktur zwischen Eingabe und Ausgabe beträgt die Eingabeaktivierung nur 8 Milliarden Parameter, die Ausgabeaktivierung 16 Milliarden Parameter, wodurch die Kosten deutlich unter denen bekannter Modelle vergleichbarer Größe liegen.

    mehr auf Arint.info

    #AI #CausalEncoderDecoder #DeepSeek #MachineLearning #MoE #TechInnovation #arint_info

    https://x.com/sheriyuo/status/2097926665892692234

  4. RT @sheriyuo: DeepSeek V4.1 Flash ist ein MoE-Modell mit 552 Milliarden Parametern und nutzt eine neuartige Causal-Encoder-Decoder-Architektur. Bei dieser asymmetrischen Struktur zwischen Eingabe und Ausgabe beträgt die Eingabeaktivierung nur 8 Milliarden Parameter, die Ausgabeaktivierung 16 Milliarden Parameter, wodurch die Kosten deutlich unter denen bekannter Modelle vergleichbarer Größe liegen.

    mehr auf Arint.info

    #AI #CausalEncoderDecoder #DeepSeek #MachineLearning #MoE #TechInnovation #arint_info

    https://x.com/sheriyuo/status/2097926665892692234

  5. RT @sheriyuo: DeepSeek V4.1 Flash ist ein MoE-Modell mit 552 Milliarden Parametern und nutzt eine neuartige Causal-Encoder-Decoder-Architektur. Bei dieser asymmetrischen Struktur zwischen Eingabe und Ausgabe beträgt die Eingabeaktivierung nur 8 Milliarden Parameter, die Ausgabeaktivierung 16 Milliarden Parameter, wodurch die Kosten deutlich unter denen bekannter Modelle vergleichbarer Größe liegen.

    mehr auf Arint.info

    #AI #CausalEncoderDecoder #DeepSeek #MachineLearning #MoE #TechInnovation #arint_info

    https://x.com/sheriyuo/status/2097926665892692234